{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,17]],"date-time":"2026-08-17T15:01:11Z","timestamp":1786978871752,"version":"build-2736575974"},"publisher-location":"Cham","reference-count":76,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031200649","type":"print"},{"value":"9783031200656","type":"electronic"}],"license":[{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022]]},"DOI":"10.1007\/978-3-031-20065-6_25","type":"book-chapter","created":{"date-parts":[[2022,11,2]],"date-time":"2022-11-02T16:24:03Z","timestamp":1667406243000},"page":"424-442","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":76,"title":["PPT: Token-Pruned Pose Transformer for\u00a0Monocular and\u00a0Multi-view Human Pose Estimation"],"prefix":"10.1007","author":[{"given":"Haoyu","family":"Ma","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhe","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yifei","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Deying","family":"Kong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Liangjian","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xingwei","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiangyi","family":"Yan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hao","family":"Tang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaohui","family":"Xie","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,11,3]]},"reference":[{"key":"25_CR1","doi-asserted-by":"crossref","unstructured":"Andriluka, M., Pishchulin, L., Gehler, P., Schiele, B.: 2D human pose estimation: new benchmark and state of the art analysis. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.471"},{"key":"25_CR2","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"213","DOI":"10.1007\/978-3-030-58452-8_13","volume-title":"Computer Vision \u2013 ECCV 2020","author":"N Carion","year":"2020","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., Zagoruyko, S.: End-to-end object detection with transformers. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12346, pp. 213\u2013229. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58452-8_13"},{"key":"25_CR3","doi-asserted-by":"crossref","unstructured":"Caron, M., et al.: Emerging properties in self-supervised vision transformers. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"25_CR4","doi-asserted-by":"crossref","unstructured":"Ionescu, C., Li, F., Sminchisescu, C.: Latent structured models for human pose estimation. In: ICCV (2011)","DOI":"10.1109\/ICCV.2011.6126500"},{"key":"25_CR5","doi-asserted-by":"crossref","unstructured":"Chen, C.F., Fan, Q., Panda, R.: CrossViT: cross-attention multi-scale vision transformer for image classification. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00041"},{"key":"25_CR6","doi-asserted-by":"crossref","unstructured":"Chen, L., Lin, S.Y., Xie, Y., Lin, Y.Y., Xie, X.: MVHM: a large-scale multi-view hand mesh benchmark for accurate 3D hand pose estimation. In: WACV, pp. 836\u2013845 (2021)","DOI":"10.1109\/WACV48630.2021.00088"},{"key":"25_CR7","unstructured":"Chen, T., Cheng, Y., Gan, Z., Yuan, L., Zhang, L., Wang, Z.: Chasing sparsity in vision transformers: an end-to-end exploration. In: NeurIPS (2021)"},{"key":"25_CR8","doi-asserted-by":"crossref","unstructured":"Chen, T., Zhang, Z., Cheng, Y., Awadallah, A., Wang, Z.: The principle of diversity: training stronger vision transformers calls for reducing all levels of redundancy. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01171"},{"key":"25_CR9","doi-asserted-by":"crossref","unstructured":"Chen, X., Cao, Q., Zhong, Y., Zhang, J., Gao, S., Tao, D.: DearKD: data-efficient early knowledge distillation for vision transformers. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01174"},{"key":"25_CR10","doi-asserted-by":"crossref","unstructured":"Chen, Y., et al.: Nonparametric structure regularization machine for 2D hand pose estimation. In: WACV (2020)","DOI":"10.1109\/WACV45572.2020.9093271"},{"key":"25_CR11","doi-asserted-by":"crossref","unstructured":"Chen, Y., Ma, H., Wang, J., Wu, J., Wu, X., Xie, X.: PD-Net: quantitative motor function evaluation for Parkinson\u2019s disease via automated hand gesture analysis. In: KDD (2021)","DOI":"10.1145\/3447548.3467130"},{"key":"25_CR12","doi-asserted-by":"crossref","unstructured":"Chen, Y., Wang, Z., Peng, Y., Zhang, Z., Yu, G., Sun, J.: Cascaded pyramid network for multi-person pose estimation. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00742"},{"key":"25_CR13","doi-asserted-by":"crossref","unstructured":"Chu, X., Yang, W., Ouyang, W., Ma, C., Yuille, A.L., Wang, X.: Multi-context attention for human pose estimation. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.601"},{"key":"25_CR14","unstructured":"Dosovitskiy, A., et al.: An image is worth $$16 \\times 16$$ words: transformers for image recognition at scale. In: ICLR (2021)"},{"key":"25_CR15","unstructured":"Fang, Y., et al.: You only look at one sequence: rethinking transformer in vision through object detection. In: NeurIPS (2021)"},{"key":"25_CR16","doi-asserted-by":"publisher","first-page":"77","DOI":"10.1109\/JBHI.2017.2659758","volume":"22","author":"B Fasel","year":"2017","unstructured":"Fasel, B., Sp\u00f6rri, J., Chardonnens, J., Kr\u00f6ll, J., M\u00fcller, E., Aminian, K.: Joint inertial sensor orientation drift reduction for highly dynamic movements. IEEE J. Biomed. Health Inform. 22, 77\u201386 (2017)","journal-title":"IEEE J. Biomed. Health Inform."},{"key":"25_CR17","unstructured":"Han, S., Mao, H., Dally, W.J.: Deep compression: compressing deep neural networks with pruning, trained quantization and Huffman coding. In: ICLR (2016)"},{"key":"25_CR18","doi-asserted-by":"crossref","unstructured":"He, K., Gkioxari, G., Doll\u00e1r, P., Girshick, R.: Mask R-CNN. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.322"},{"key":"25_CR19","doi-asserted-by":"crossref","unstructured":"He, Y., Yan, R., Fragkiadaki, K., Yu, S.I.: Epipolar transformers. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00780"},{"key":"25_CR20","unstructured":"Hinton, G., Vinyals, O., Dean, J.: Distilling the knowledge in a neural network. arXiv preprint arXiv:1503.02531 (2015)"},{"key":"25_CR21","doi-asserted-by":"crossref","unstructured":"Huang, Z., Wan, C., Probst, T., Van Gool, L.: Deep learning on lie groups for skeleton-based action recognition. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.137"},{"key":"25_CR22","doi-asserted-by":"publisher","first-page":"1325","DOI":"10.1109\/TPAMI.2013.248","volume":"36","author":"C Ionescu","year":"2014","unstructured":"Ionescu, C., Papava, D., Olaru, V., Sminchisescu, C.: Human3.6m: large scale datasets and predictive methods for 3D human sensing in natural environments. IEEE Trans. Pattern Anal. Mach. Intell. 36, 1325\u20131339 (2014)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"25_CR23","doi-asserted-by":"crossref","unstructured":"Iskakov, K., Burkov, E., Lempitsky, V., Malkov, Y.: Learnable triangulation of human pose. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00781"},{"key":"25_CR24","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"731","DOI":"10.1007\/978-3-030-01216-8_44","volume-title":"Computer Vision \u2013 ECCV 2018","author":"L Ke","year":"2018","unstructured":"Ke, L., Chang, M.-C., Qi, H., Lyu, S.: Multi-scale structure-aware network for human pose estimation. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11206, pp. 731\u2013746. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01216-8_44"},{"key":"25_CR25","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. In: ICLR (2015)"},{"key":"25_CR26","doi-asserted-by":"crossref","unstructured":"Kong, D., Chen, Y., Ma, H., Yan, X., Xie, X.: Adaptive graphical model network for 2D handpose estimation. In: BMVC (2019)","DOI":"10.1109\/WACV45572.2020.9093638"},{"key":"25_CR27","doi-asserted-by":"crossref","unstructured":"Kong, D., Ma, H., Chen, Y., Xie, X.: Rotation-invariant mixed graphical model network for 2D hand pose estimation. In: WACV (2020)","DOI":"10.1109\/WACV45572.2020.9093638"},{"key":"25_CR28","unstructured":"Kong, D., Ma, H., Xie, X.: SIA-GCN: a spatial information aware graph neural network with 2D convolutions for hand pose estimation. In: BMVC (2020)"},{"key":"25_CR29","doi-asserted-by":"crossref","unstructured":"Kong, Z., et al.: SpViT: enabling faster vision transformers via soft token pruning. arXiv preprint arXiv:2112.13890 (2021)","DOI":"10.1007\/978-3-031-20083-0_37"},{"key":"25_CR30","doi-asserted-by":"crossref","unstructured":"Li, K., Wang, S., Zhang, X., Xu, Y., Xu, W., Tu, Z.: Pose recognition with cascade transformers. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00198"},{"key":"25_CR31","doi-asserted-by":"crossref","unstructured":"Li, Y., et al.: TokenPose: learning keypoint tokens for human pose estimation. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.01112"},{"key":"25_CR32","unstructured":"Liang, Y., Ge, C., Tong, Z., Song, Y., Wang, J., Xie, P.: EViT: expediting vision transformers via token reorganizations. In: ICLR (2022)"},{"key":"25_CR33","doi-asserted-by":"crossref","unstructured":"Lin, K., Wang, L., Liu, Z.: End-to-end human pose and mesh reconstruction with transformers. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00199"},{"key":"25_CR34","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"740","DOI":"10.1007\/978-3-319-10602-1_48","volume-title":"Computer Vision \u2013 ECCV 2014","author":"T-Y Lin","year":"2014","unstructured":"Lin, T.-Y., et al.: Microsoft COCO: common objects in context. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8693, pp. 740\u2013755. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10602-1_48"},{"key":"25_CR35","doi-asserted-by":"crossref","unstructured":"Liu, Z., et al.: Swin transformer: hierarchical vision transformer using shifted windows. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"25_CR36","unstructured":"Ma, H., et al.: Transfusion: cross-view fusion with transformer for 3D human pose estimation. In: BMVC (2021)"},{"key":"25_CR37","doi-asserted-by":"crossref","unstructured":"Mao, W., Ge, Y., Shen, C., Tian, Z., Wang, X., Wang, Z.: TFPose: direct human pose estimation with transformers. arXiv preprint arXiv:2103.15320 (2021)","DOI":"10.1007\/978-3-031-20068-7_5"},{"key":"25_CR38","doi-asserted-by":"crossref","unstructured":"Meng, L., et al.: AdaViT: adaptive vision transformers for efficient image recognition. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01199"},{"key":"25_CR39","doi-asserted-by":"crossref","unstructured":"Neff, C., Sheth, A., Furgurson, S., Tabkhi, H.: EfficientHRNet: efficient scaling for lightweight high-resolution multi-person pose estimation. arXiv preprint arXiv:2007.08090 (2020)","DOI":"10.1007\/s11554-021-01132-9"},{"key":"25_CR40","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"483","DOI":"10.1007\/978-3-319-46484-8_29","volume-title":"Computer Vision \u2013 ECCV 2016","author":"A Newell","year":"2016","unstructured":"Newell, A., Yang, K., Deng, J.: Stacked hourglass networks for human pose estimation. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9912, pp. 483\u2013499. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46484-8_29"},{"key":"25_CR41","doi-asserted-by":"crossref","unstructured":"Osokin, D.: Real-time 2D multi-person pose estimation on CPU: lightweight openpose. arXiv preprint arXiv:1811.12004 (2018)","DOI":"10.5220\/0007555407440748"},{"key":"25_CR42","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"282","DOI":"10.1007\/978-3-030-01264-9_17","volume-title":"Computer Vision \u2013 ECCV 2018","author":"G Papandreou","year":"2018","unstructured":"Papandreou, G., Zhu, T., Chen, L.-C., Gidaris, S., Tompson, J., Murphy, K.: PersonLab: person pose estimation and instance segmentation with a bottom-up, part-based, geometric embedding model. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11218, pp. 282\u2013299. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01264-9_17"},{"key":"25_CR43","doi-asserted-by":"crossref","unstructured":"Qiu, H., Wang, C., Wang, J., Wang, N., Zeng, W.: Cross view fusion for 3D human pose estimation. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00444"},{"key":"25_CR44","unstructured":"Rao, Y., Zhao, W., Liu, B., Lu, J., Zhou, J., Hsieh, C.J.: DynamicViT: efficient vision transformers with dynamic token sparsification. In: NeurIPS (2021)"},{"key":"25_CR45","unstructured":"Ryoo, M., Piergiovanni, A., Arnab, A., Dehghani, M., Angelova, A.: TokenLearner: adaptive space-time tokenization for videos. In: NeurIPS (2021)"},{"key":"25_CR46","doi-asserted-by":"crossref","unstructured":"Shen, S., et al.: Q-BERT: hessian based ultra low precision quantization of BERT. In: AAAI (2020)","DOI":"10.1609\/aaai.v34i05.6409"},{"key":"25_CR47","doi-asserted-by":"crossref","unstructured":"Shen, X., et al.: Towards fast and accurate multi-person pose estimation on mobile devices. arXiv preprint arXiv:2106.15304 (2021)","DOI":"10.24963\/ijcai.2021\/715"},{"key":"25_CR48","doi-asserted-by":"crossref","unstructured":"Simon, T., Joo, H., Matthews, I., Sheikh, Y.: Hand keypoint detection in single images using multiview bootstrapping. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.494"},{"key":"25_CR49","unstructured":"Sp\u00f6rri, J.: Research dedicated to sports injury prevention-the \u2018sequence of prevention\u2019 on the example of alpine ski racing. Habilitation with Venia Docendi in Biomechanics (2016)"},{"key":"25_CR50","doi-asserted-by":"crossref","unstructured":"Sun, K., Xiao, B., Liu, D., Wang, J.: Deep high-resolution representation learning for human pose estimation. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00584"},{"key":"25_CR51","unstructured":"Sun, M., et al.: VAQF: fully automatic software-hardware co-design framework for low-bit vision transformer. arXiv preprint arXiv:2201.06618 (2022)"},{"key":"25_CR52","unstructured":"Tompson, J.J., Jain, A., LeCun, Y., Bregler, C.: Joint training of a convolutional network and a graphical model for human pose estimation. In: NIPS (2014)"},{"key":"25_CR53","doi-asserted-by":"crossref","unstructured":"Toshev, A., Szegedy, C.: DeepPose: human pose estimation via deep neural networks. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.214"},{"key":"25_CR54","unstructured":"Touvron, H., Cord, M., Douze, M., Massa, F., Sablayrolles, A., J\u00e9gou, H.: Training data-efficient image transformers & distillation through attention. In: ICML (2021)"},{"key":"25_CR55","unstructured":"Vaswani, A., et al.: Attention is all you need. In: NIPS (2017)"},{"key":"25_CR56","doi-asserted-by":"crossref","unstructured":"Wang, X., Girshick, R., Gupta, A., He, K.: Non-local neural networks. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00813"},{"key":"25_CR57","doi-asserted-by":"crossref","unstructured":"Wang, Y., Li, M., Cai, H., Chen, W.M., Han, S.: Lite pose: efficient architecture design for 2D human pose estimation. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01278"},{"key":"25_CR58","doi-asserted-by":"crossref","unstructured":"Wang, Y., et al.: End-to-end video instance segmentation with transformers. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00863"},{"key":"25_CR59","doi-asserted-by":"crossref","unstructured":"Wang, Z., Yang, J., Fowlkes, C.: The best of both worlds: combining model-based and nonparametric approaches for 3D human body estimation. In: CVPR ABAW Workshop (2022)","DOI":"10.1109\/CVPRW56347.2022.00258"},{"key":"25_CR60","doi-asserted-by":"crossref","unstructured":"Wang, Z., Chen, L., Rathore, S., Shin, D., Fowlkes, C.: Geometric pose affordance: 3D human pose with scene constraints. arXiv preprint arXiv:1905.07718 (2019)","DOI":"10.1007\/978-3-031-25075-0_1"},{"key":"25_CR61","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"523","DOI":"10.1007\/978-3-030-66096-3_36","volume-title":"Computer Vision \u2013 ECCV 2020 Workshops","author":"Z Wang","year":"2020","unstructured":"Wang, Z., Shin, D., Fowlkes, C.C.: Predicting camera viewpoint improves cross-dataset generalization for 3D human pose estimation. In: Bartoli, A., Fusiello, A. (eds.) ECCV 2020. LNCS, vol. 12536, pp. 523\u2013540. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-66096-3_36"},{"key":"25_CR62","doi-asserted-by":"crossref","unstructured":"Wei, S.E., Ramakrishna, V., Kanade, T., Sheikh, Y.: Convolutional pose machines. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.511"},{"key":"25_CR63","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"472","DOI":"10.1007\/978-3-030-01231-1_29","volume-title":"Computer Vision \u2013 ECCV 2018","author":"B Xiao","year":"2018","unstructured":"Xiao, B., Wu, H., Wei, Y.: Simple baselines for human pose estimation and tracking. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11210, pp. 472\u2013487. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01231-1_29"},{"key":"25_CR64","doi-asserted-by":"crossref","unstructured":"Xie, R., Wang, C., Wang, Y.: MetaFuse: a pre-trained fusion model for human pose estimation. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.01370"},{"key":"25_CR65","doi-asserted-by":"crossref","unstructured":"Yan, S., Xiong, Y., Lin, D.: Spatial temporal graph convolutional networks for skeleton-based action recognition. In: AAAI (2018)","DOI":"10.1609\/aaai.v32i1.12328"},{"key":"25_CR66","doi-asserted-by":"crossref","unstructured":"Yan, X., Tang, H., Sun, S., Ma, H., Kong, D., Xie, X.: AFTer-UNet: axial fusion transformer UNet for medical image segmentation. In: WACV (2022)","DOI":"10.1109\/WACV51458.2022.00333"},{"key":"25_CR67","doi-asserted-by":"crossref","unstructured":"Yang, S., Quan, Z., Nie, M., Yang, W.: TransPose: keypoint localization via transformer. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.01159"},{"key":"25_CR68","unstructured":"You, C., et al.: Class-aware generative adversarial transformers for medical image segmentation. arXiv preprint arXiv:2201.10737 (2022)"},{"key":"25_CR69","doi-asserted-by":"crossref","unstructured":"Yu, C., et al.: Lite-HRNet: a lightweight high-resolution network. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.01030"},{"key":"25_CR70","unstructured":"Yu, S., et al.: Unified visual transformer compression. In: ICLR (2022)"},{"key":"25_CR71","doi-asserted-by":"crossref","unstructured":"Yuan, L., et al.: Tokens-to-token ViT: training vision transformers from scratch on imagenet. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00060"},{"issue":"3","key":"25_CR72","doi-asserted-by":"publisher","first-page":"335","DOI":"10.1007\/s41095-021-0214-z","volume":"7","author":"W Zhang","year":"2021","unstructured":"Zhang, W., Fang, J., Wang, X., Liu, W.: EfficientPose: efficient human pose estimation with neural architecture search. Comput. Vis. Media 7(3), 335\u2013347 (2021). https:\/\/doi.org\/10.1007\/s41095-021-0214-z","journal-title":"Comput. Vis. Media"},{"key":"25_CR73","doi-asserted-by":"publisher","first-page":"703","DOI":"10.1007\/s11263-020-01398-9","volume":"129","author":"Z Zhang","year":"2021","unstructured":"Zhang, Z., Wang, C., Qiu, W., Qin, W., Zeng, W.: AdaFuse: adaptive multiview fusion for accurate human pose estimation in the wild. IJCV 129, 703\u2013718 (2021)","journal-title":"IJCV"},{"key":"25_CR74","doi-asserted-by":"crossref","unstructured":"Zheng, C., Zhu, S., Mendieta, M., Yang, T., Chen, C., Ding, Z.: 3D human pose estimation with spatial and temporal transformers. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.01145"},{"key":"25_CR75","doi-asserted-by":"crossref","unstructured":"Zheng, S., et al.: Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00681"},{"key":"25_CR76","unstructured":"Zhu, X., Su, W., Lu, L., Li, B., Wang, X., Dai, J.: Deformable DETR: deformable transformers for end-to-end object detection. In: ICLR (2021)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2022"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-20065-6_25","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,3,10]],"date-time":"2023-03-10T19:51:51Z","timestamp":1678477911000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-20065-6_25"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022]]},"ISBN":["9783031200649","9783031200656"],"references-count":76,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-20065-6_25","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022]]},"assertion":[{"value":"3 November 2022","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Tel Aviv","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Israel","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2022","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"23 October 2022","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27 October 2022","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2022","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2022.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Double-blind","order":1,"name":"type","label":"Type","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"CMT","order":2,"name":"conference_management_system","label":"Conference Management System","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"5804","order":3,"name":"number_of_submissions_sent_for_review","label":"Number of Submissions Sent for Review","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"1645","order":4,"name":"number_of_full_papers_accepted","label":"Number of Full Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"0","order":5,"name":"number_of_short_papers_accepted","label":"Number of Short Papers Accepted","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"28% - The value is computed by the equation \"Number of Full Papers Accepted \/ Number of Submissions Sent for Review * 100\" and then rounded to a whole number.","order":6,"name":"acceptance_rate_of_full_papers","label":"Acceptance Rate of Full Papers","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.21","order":7,"name":"average_number_of_reviews_per_paper","label":"Average Number of Reviews per Paper","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"3.91","order":8,"name":"average_number_of_papers_per_reviewer","label":"Average Number of Papers per Reviewer","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}},{"value":"Yes","order":9,"name":"external_reviewers_involved","label":"External Reviewers Involved","group":{"name":"ConfEventPeerReviewInformation","label":"Peer Review Information (provided by the conference organizers)"}}]}}