{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T12:34:21Z","timestamp":1777552461451,"version":"3.51.4"},"reference-count":48,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2025,4,16]],"date-time":"2025-04-16T00:00:00Z","timestamp":1744761600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,4,16]],"date-time":"2025-04-16T00:00:00Z","timestamp":1744761600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61572064"],"award-info":[{"award-number":["61572064"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Center for Ethnic and Folk Literature and Art Development of Ministry of Culture"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Mach Learn"],"published-print":{"date-parts":[[2025,6]]},"DOI":"10.1007\/s10994-025-06759-4","type":"journal-article","created":{"date-parts":[[2025,4,16]],"date-time":"2025-04-16T15:32:31Z","timestamp":1744817551000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":7,"title":["Low-resolution human pose estimation and action recognition via pose-driven super-resolution reconstruction"],"prefix":"10.1007","volume":"114","author":[{"given":"Zhizhuo","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9520-5425","authenticated-orcid":false,"given":"Lili","family":"Wan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wanru","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shenghui","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,4,16]]},"reference":[{"key":"6759_CR1","doi-asserted-by":"crossref","unstructured":"Andriluka, M., Pishchulin, L., Gehler, P., & Schiele, B. (2014). 2d human pose estimation: New benchmark and state of the art analysis. In: Proceedings of the IEEE Conference on computer Vision and Pattern Recognition, pp 3686\u20133693","DOI":"10.1109\/CVPR.2014.471"},{"key":"6759_CR2","doi-asserted-by":"crossref","unstructured":"Ch\u00e9ron, G., Laptev, I., & Schmid, C. (2015). P-cnn: Pose-based cnn features for action recognition. In: Proceedings of the IEEE international conference on computer vision, pp 3218\u20133226","DOI":"10.1109\/ICCV.2015.368"},{"key":"6759_CR3","doi-asserted-by":"crossref","unstructured":"Dai, D., Wang, Y., Chen, Y., & Van\u00a0Gool, L. (2016). Is image super-resolution helpful for other vision tasks? In: 2016 IEEE Winter Conference on Applications of Computer Vision (WACV), IEEE, pp 1\u20139","DOI":"10.1109\/WACV.2016.7477613"},{"key":"6759_CR4","doi-asserted-by":"crossref","unstructured":"Donahue, J., Anne\u00a0Hendricks, L., Guadarrama, S., Rohrbach, M., Venugopalan, S., Saenko, K., & Darrell, T. (2015). Long-term recurrent convolutional networks for visual recognition and description. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2625\u20132634","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"6759_CR5","doi-asserted-by":"crossref","unstructured":"Dong, C., Loy CC, He, K., & Tang, X. (2014). Learning a deep convolutional network for image super-resolution. In: European conference on computer vision, Springer, pp 184\u2013199","DOI":"10.1007\/978-3-319-10593-2_13"},{"key":"6759_CR6","doi-asserted-by":"crossref","unstructured":"Dong, C., Loy CC, & Tang, X. (2016). Accelerating the super-resolution convolutional neural network. In: European conference on computer vision, Springer, pp 391\u2013407","DOI":"10.1007\/978-3-319-46475-6_25"},{"key":"6759_CR7","doi-asserted-by":"crossref","unstructured":"Du, W., Wang, Y., & Qiao, Y. (2017). Rpan: An end-to-end recurrent pose-attention network for action recognition in videos. In: Proceedings of the IEEE International Conference on Computer Vision, pp 3725\u20133734","DOI":"10.1109\/ICCV.2017.402"},{"key":"6759_CR8","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Pinz, A., & Zisserman, A. (2016). Convolutional two-stream network fusion for video action recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1933\u20131941","DOI":"10.1109\/CVPR.2016.213"},{"issue":"1","key":"6759_CR9","doi-asserted-by":"publisher","first-page":"55","DOI":"10.1023\/B:VISI.0000042934.15159.49","volume":"61","author":"PF Felzenszwalb","year":"2005","unstructured":"Felzenszwalb, P. F., & Huttenlocher, D. P. (2005). Pictorial structures for object recognition. International Journal of Computer Vision, 61(1), 55\u201379.","journal-title":"International Journal of Computer Vision"},{"issue":"1","key":"6759_CR10","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1109\/T-C.1973.223602","volume":"100","author":"MA Fischler","year":"1973","unstructured":"Fischler, M. A., & Elschlager, R. A. (1973). The representation and matching of pictorial structures. IEEE Transactions on Computers, 100(1), 67\u201392.","journal-title":"IEEE Transactions on Computers"},{"issue":"12","key":"6759_CR11","doi-asserted-by":"publisher","first-page":"1966","DOI":"10.3390\/s16121966","volume":"16","author":"W Gong","year":"2016","unstructured":"Gong, W., Zhang, X., Gonz\u00e0lez, J., Sobral, A., Bouwmans, T., Tu, C., & Zahzah, Eh. (2016). Human pose estimation from monocular images: A comprehensive survey. Sensors, 16(12), 1966.","journal-title":"Sensors"},{"key":"6759_CR12","unstructured":"Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A., & Bengio, Y. (2014). Generative adversarial nets. In: Advances in neural information processing systems, pp 2672\u20132680"},{"key":"6759_CR13","doi-asserted-by":"publisher","first-page":"354","DOI":"10.1016\/j.patcog.2017.10.013","volume":"77","author":"J Gu","year":"2018","unstructured":"Gu, J., Wang, Z., Kuen, J., Ma, L., Shahroudy, A., Shuai, B., Liu, T., Wang, X., Wang, G., Cai, J., & Chen, T. (2018). Recent advances in convolutional neural networks. Pattern Recognition, 77, 354\u2013377.","journal-title":"Pattern Recognition"},{"key":"6759_CR14","doi-asserted-by":"crossref","unstructured":"Haris, M., Shakhnarovich, G., & Ukita, N. (2018a). Deep back-projection networks for super-resolution. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1664\u20131673","DOI":"10.1109\/CVPR.2018.00179"},{"key":"6759_CR15","unstructured":"Haris, M., Shakhnarovich, G., & Ukita, N. (2018b). Task-driven super resolution: Object detection in low-resolution images. arXiv preprint arXiv:1803.11316"},{"key":"6759_CR16","doi-asserted-by":"publisher","first-page":"4","DOI":"10.1016\/j.imavis.2017.01.010","volume":"60","author":"S Herath","year":"2017","unstructured":"Herath, S., Harandi, M., & Porikli, F. (2017). Going deeper into action recognition: A survey. Image and Vision Computing, 60, 4\u201321.","journal-title":"Image and Vision Computing"},{"key":"6759_CR17","unstructured":"Johnson, S., & Everingham, M. (2010). Clustered pose and nonlinear appearance models for human pose estimation. In: bmvc, Citeseer, vol\u00a02, p\u00a05"},{"key":"6759_CR18","doi-asserted-by":"crossref","unstructured":"Kim, J., Kwon\u00a0Lee, J., & Mu\u00a0Lee, K. (2016a). Accurate image super-resolution using very deep convolutional networks. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1646\u20131654","DOI":"10.1109\/CVPR.2016.182"},{"key":"6759_CR19","doi-asserted-by":"crossref","unstructured":"Kim, J., Kwon\u00a0Lee, J., & Mu\u00a0Lee, K. (2016b). Deeply-recursive convolutional network for image super-resolution. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1637\u20131645","DOI":"10.1109\/CVPR.2016.181"},{"key":"6759_CR20","doi-asserted-by":"crossref","unstructured":"Kreiss, S., Bertoni, L., & Alahi, A. (2019). Pifpaf: Composite fields for human pose estimation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 11977\u201311986","DOI":"10.1109\/CVPR.2019.01225"},{"key":"6759_CR21","doi-asserted-by":"crossref","unstructured":"Lai WS, Huang JB, Ahuja, N., Yang MH (2017). Deep laplacian pyramid networks for fast and accurate super-resolution. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 624\u2013632","DOI":"10.1109\/CVPR.2017.618"},{"key":"6759_CR22","doi-asserted-by":"crossref","unstructured":"Ledig, C., Theis, L., Husz\u00e1r, F., Caballero, J., Cunningham, A., Acosta, A., Aitken, A., Tejani, A., Totz, J., Wang, Z., & et\u00a0al. (2017). Photo-realistic single image super-resolution using a generative adversarial network. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4681\u20134690","DOI":"10.1109\/CVPR.2017.19"},{"issue":"8","key":"6759_CR23","doi-asserted-by":"publisher","first-page":"2000","DOI":"10.1109\/TIFS.2018.2890812","volume":"14","author":"P Li","year":"2019","unstructured":"Li, P., Prieto, L., Mery, D., & Flynn, P. J. (2019). On low-resolution face recognition in the wild: Comparisons and new techniques. IEEE Transactions on Information Forensics and Security, 14(8), 2000\u20132012.","journal-title":"IEEE Transactions on Information Forensics and Security"},{"key":"6759_CR24","doi-asserted-by":"crossref","unstructured":"Luvizon DC, Picard, D., & Tabia, H. (2018). 2d\/3d pose estimation and action recognition using multitask deep learning. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 5137\u20135146","DOI":"10.1109\/CVPR.2018.00539"},{"key":"6759_CR25","doi-asserted-by":"publisher","first-page":"15","DOI":"10.1016\/j.cag.2019.09.002","volume":"85","author":"DC Luvizon","year":"2019","unstructured":"Luvizon, D. C., Tabia, H., & Picard, D. (2019). Human pose regression by combining indirect part detection and contextual information. Computers & Graphics, 85, 15\u201322.","journal-title":"Computers & Graphics"},{"issue":"6","key":"6759_CR26","doi-asserted-by":"publisher","first-page":"1423","DOI":"10.1007\/s00138-014-0623-4","volume":"25","author":"K Nasrollahi","year":"2014","unstructured":"Nasrollahi, K., & Moeslund, T. B. (2014). Super-resolution: a comprehensive survey. Machine Vision and Applications, 25(6), 1423\u20131468.","journal-title":"Machine Vision and Applications"},{"key":"6759_CR27","doi-asserted-by":"crossref","unstructured":"Neumann, L., & Vedaldi, A. (2018). Tiny people pose. In: Asian Conference on Computer Vision, Springer, pp 558\u2013574","DOI":"10.1007\/978-3-030-20893-6_35"},{"key":"6759_CR28","doi-asserted-by":"crossref","unstructured":"Newell, A., Yang, K., & Deng, J. (2016). Stacked hourglass networks for human pose estimation. In: European conference on computer vision, Springer, pp 483\u2013499","DOI":"10.1007\/978-3-319-46484-8_29"},{"key":"6759_CR29","doi-asserted-by":"crossref","unstructured":"Sapp, B., & Taskar, B. (2013). Modec: Multimodal decomposable models for human pose estimation. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 3674\u20133681","DOI":"10.1109\/CVPR.2013.471"},{"key":"6759_CR30","doi-asserted-by":"crossref","unstructured":"Shermeyer, J., & Van Etten, A. (2019). The effects of super-resolution on object detection performance in satellite imagery. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp 1432\u20131441","DOI":"10.1109\/CVPRW.2019.00184"},{"key":"6759_CR31","doi-asserted-by":"crossref","unstructured":"Shi, W., Caballero, J., Husz\u00e1r, F., Totz, J., Aitken AP, Bishop, R., Rueckert, D., Wang Z (2016). Real-time single image and video super-resolution using an efficient sub-pixel convolutional neural network. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1874\u20131883","DOI":"10.1109\/CVPR.2016.207"},{"key":"6759_CR32","unstructured":"Simonyan, K., & Zisserman, A. (2014). Two-stream convolutional networks for action recognition in videos. In: Advances in neural information processing systems, pp 568\u2013576"},{"key":"6759_CR33","unstructured":"Srivastava, N., Mansimov, E., & Salakhudinov, R. (2015). Unsupervised learning of video representations using lstms. In: International conference on machine learning, pp 843\u2013852"},{"key":"6759_CR34","doi-asserted-by":"crossref","unstructured":"Sun, K., Xiao, B., Liu, D., & Wang, J. (2019). Deep high-resolution representation learning for human pose estimation. arXiv preprint arXiv:1902.09212","DOI":"10.1109\/CVPR.2019.00584"},{"key":"6759_CR35","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Ioffe, S., Vanhoucke, V., Alemi AA (2017). Inception-v4, inception-resnet and the impact of residual connections on learning. In: Thirty-first AAAI conference on artificial intelligence","DOI":"10.1609\/aaai.v31i1.11231"},{"key":"6759_CR36","doi-asserted-by":"crossref","unstructured":"Tai, Y., Yang, J., & Liu, X. (2017). Image super-resolution via deep recursive residual network. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3147\u20133155","DOI":"10.1109\/CVPR.2017.298"},{"key":"6759_CR37","doi-asserted-by":"crossref","unstructured":"Tompson, J., Goroshin, R., Jain, A., LeCun, Y., & Bregler, C. (2015). Efficient object localization using convolutional networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 648\u2013656","DOI":"10.1109\/CVPR.2015.7298664"},{"key":"6759_CR38","doi-asserted-by":"crossref","unstructured":"Toshev, A., & Szegedy, C. (2014). Deeppose: Human pose estimation via deep neural networks. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1653\u20131660","DOI":"10.1109\/CVPR.2014.214"},{"key":"6759_CR39","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., & Paluri, M. (2015). Learning spatiotemporal features with 3d convolutional networks. In: Proceedings of the IEEE international conference on computer vision, pp 4489\u20134497","DOI":"10.1109\/ICCV.2015.510"},{"key":"6759_CR40","doi-asserted-by":"crossref","unstructured":"Wang, H., & Schmid, C. (2013). Action recognition with improved trajectories. In: Proceedings of the IEEE international conference on computer vision, pp 3551\u20133558","DOI":"10.1109\/ICCV.2013.441"},{"key":"6759_CR41","doi-asserted-by":"crossref","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., Liu CL (2011). Action recognition by dense trajectories. In: CVPR 2011, IEEE, pp 3169\u20133176","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"6759_CR42","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., & Van\u00a0Gool, L. (2016). Temporal segment networks: Towards good practices for deep action recognition. In: European conference on computer vision, Springer, pp 20\u201336","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"6759_CR43","doi-asserted-by":"crossref","unstructured":"Wei SE, Ramakrishna, V., Kanade, T., & Sheikh, Y. (2016). Convolutional pose machines. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 4724\u20134732","DOI":"10.1109\/CVPR.2016.511"},{"key":"6759_CR44","doi-asserted-by":"crossref","unstructured":"Xiao, B., Wu, H., & Wei, Y. (2018). Simple baselines for human pose estimation and tracking. In: Proceedings of the European conference on computer vision (ECCV), pp 466\u2013481","DOI":"10.1007\/978-3-030-01231-1_29"},{"issue":"12","key":"6759_CR45","doi-asserted-by":"publisher","first-page":"2878","DOI":"10.1109\/TPAMI.2012.261","volume":"35","author":"Y Yang","year":"2012","unstructured":"Yang, Y., & Ramanan, D. (2012). Articulated human detection with flexible mixtures of parts. IEEE Transactions on Pattern Analysis and Machine Intelligence, 35(12), 2878\u20132890.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"6759_CR46","doi-asserted-by":"crossref","unstructured":"Yue-Hei\u00a0Ng, J., Hausknecht, M., Vijayanarasimhan, S., Vinyals, O., Monga, R., & Toderici, G. (2015). Beyond short snippets: Deep networks for video classification. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4694\u20134702","DOI":"10.1109\/CVPR.2015.7299101"},{"key":"6759_CR47","doi-asserted-by":"crossref","unstructured":"Zhang, W., Zhu, M., Derpanis KG (2013). From actemes to action: A strongly-supervised representation for detailed action understanding. In: Proceedings of the IEEE International Conference on Computer Vision, pp 2248\u20132255","DOI":"10.1109\/ICCV.2013.280"},{"issue":"1","key":"6759_CR48","doi-asserted-by":"publisher","first-page":"47","DOI":"10.1109\/TCI.2016.2644865","volume":"3","author":"H Zhao","year":"2016","unstructured":"Zhao, H., Gallo, O., Frosio, I., & Kautz, J. (2016). Loss functions for image restoration with neural networks. IEEE Transactions on Computational Imaging, 3(1), 47\u201357.","journal-title":"IEEE Transactions on Computational Imaging"}],"container-title":["Machine Learning"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-025-06759-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10994-025-06759-4","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-025-06759-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,16]],"date-time":"2026-04-16T00:03:43Z","timestamp":1776297823000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10994-025-06759-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,16]]},"references-count":48,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2025,6]]}},"alternative-id":["6759"],"URL":"https:\/\/doi.org\/10.1007\/s10994-025-06759-4","relation":{},"ISSN":["0885-6125","1573-0565"],"issn-type":[{"value":"0885-6125","type":"print"},{"value":"1573-0565","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,4,16]]},"assertion":[{"value":"25 August 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 August 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 February 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 April 2025","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}],"article-number":"135"}}