{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,23]],"date-time":"2026-01-23T07:31:20Z","timestamp":1769153480438,"version":"3.49.0"},"reference-count":50,"publisher":"Springer Science and Business Media LLC","issue":"8","license":[{"start":{"date-parts":[[2023,6,1]],"date-time":"2023-06-01T00:00:00Z","timestamp":1685577600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,6,1]],"date-time":"2023-06-01T00:00:00Z","timestamp":1685577600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["2024581"],"award-info":[{"award-number":["2024581"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["1846031"],"award-info":[{"award-number":["1846031"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000025","name":"National Institute of Mental Health","doi-asserted-by":"publisher","award":["125377"],"award-info":[{"award-number":["125377"]}],"id":[{"id":"10.13039\/100000025","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2023,8]]},"DOI":"10.1007\/s11263-023-01804-y","type":"journal-article","created":{"date-parts":[[2023,6,1]],"date-time":"2023-06-01T07:02:41Z","timestamp":1685602961000},"page":"1980-1994","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["Self-supervised Secondary Landmark Detection via 3D Representation Learning"],"prefix":"10.1007","volume":"131","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2144-1986","authenticated-orcid":false,"given":"Praneet","family":"Bala","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jan","family":"Zimmermann","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hyun Soo","family":"Park","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Benjamin Y.","family":"Hayden","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,6,1]]},"reference":[{"key":"1804_CR1","doi-asserted-by":"crossref","unstructured":"Andriluka, M., Pishchulin, L., Gehler, P., & Schiele, B. (2014). 2D human pose estimation: New benchmark and state of the art analysis. In CVPR, 3686\u20133693.","DOI":"10.1109\/CVPR.2014.471"},{"key":"1804_CR2","doi-asserted-by":"publisher","first-page":"4560","DOI":"10.1038\/s41467-020-18441-5","volume":"11","author":"PC Bala","year":"2020","unstructured":"Bala, P. C., Eisenreich, B. R., Yoo, S. B. M., Hayden, B. Y., Park, H. S., & Zimmermann, J. (2020). Automated markerless pose estimation in freely moving macaques with openmonkeystudio. Nature Communications, 11, 4560.","journal-title":"Nature Communications"},{"key":"1804_CR3","doi-asserted-by":"crossref","unstructured":"Bouazizi, A., Wiederer, J., Kressel, U., & Belagiannis, V. (2021). Self-supervised 3d human pose estimation with multiple-view geometry. In International Conference on Automatic Face and Gesture Recognition, 1\u20138.","DOI":"10.1109\/FG52635.2021.9667074"},{"key":"1804_CR4","doi-asserted-by":"crossref","unstructured":"Cao, Z., Simon, T., Wei, S.-E., & Sheikh, Y. (2017). Realtime multi-person 2D pose estimation using part affinity fields. In CVPR, 7291\u20137299.","DOI":"10.1109\/CVPR.2017.143"},{"key":"1804_CR5","doi-asserted-by":"publisher","first-page":"172","DOI":"10.1109\/TPAMI.2019.2929257","volume":"43","author":"Z Cao","year":"2021","unstructured":"Cao, Z., Hidalgo, G., Simon, T., Wei, S.-E., & Sheikh, Y. (2021). Openpose: Realtime multi-person 2d pose estimation using part affinity fields. TPAMI, 43, 172\u2013186.","journal-title":"TPAMI"},{"key":"1804_CR6","doi-asserted-by":"crossref","unstructured":"Carissimi, N., Rota, P., Beyan, C., & Murino, V. (2018). Filling the gaps: Predicting missing joints of human poses using denoising autoencoders. In ECCV Workshops, 0\u20130.","DOI":"10.1007\/978-3-030-11012-3_29"},{"key":"1804_CR7","doi-asserted-by":"crossref","unstructured":"Ionescu, C., Li, F., Sminchisescu, C. (2011). Latent structured models for human pose estimation. In ICCV, 2220\u20132227.","DOI":"10.1109\/ICCV.2011.6126500"},{"key":"1804_CR8","doi-asserted-by":"crossref","unstructured":"Chopra, S., Hadsell, R., & LeCun, Y. (2005). Learning a similarity metric discriminatively, with application to face verification. In CVPR, 1, 539\u2013546.","DOI":"10.1109\/CVPR.2005.202"},{"key":"1804_CR9","doi-asserted-by":"publisher","first-page":"1734","DOI":"10.1109\/TPAMI.2015.2496141","volume":"38","author":"A Dosovitskiy","year":"2016","unstructured":"Dosovitskiy, A., Fischer, P., Springenberg, J. T., Riedmiller, M. A., & Brox, T. (2016). Discriminative unsupervised feature learning with exemplar convolutional neural networks. TPAMI, 38, 1734\u20131747.","journal-title":"TPAMI"},{"key":"1804_CR10","doi-asserted-by":"crossref","unstructured":"Drover, D., MV, R., Chen, C.-H., Agrawal, A., Tyagi, A., & Phuoc\u00a0Huynh, C. (2018). Can 3d pose be learned from 2D projections alone? In ECCV Workshops, 0\u20130.","DOI":"10.1007\/978-3-030-11018-5_7"},{"key":"1804_CR11","doi-asserted-by":"crossref","unstructured":"Fang, H.-S., Xie, S., Tai, Y.-W., & Lu, C. (2017). RMPE: Regional multi-person pose estimation. In ICCV, 2334\u20132343.","DOI":"10.1109\/ICCV.2017.256"},{"key":"1804_CR12","doi-asserted-by":"publisher","first-page":"48571","DOI":"10.7554\/eLife.48571","volume":"8","author":"S G\u00fcnel","year":"2019","unstructured":"G\u00fcnel, S., Rhodin, H., Morales, D., Campagnolo, J. H., Ramdya, P., & Fua, P. (2019). Deepfly3d, a deep learning-based approach for 3D limb and appendage tracking in tethered, adult drosophila. Elife, 8, 48571.","journal-title":"Elife"},{"key":"1804_CR13","unstructured":"Gutmann, M. U., & Hyv\u00e4rinen, A. (2010). Noise-contrastive estimation: A new estimation principle for unnormalized statistical models. In AISTATS, 297\u2013304."},{"key":"1804_CR14","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511811685","volume-title":"Multiple view geometry in computer vision","author":"R Hartley","year":"2004","unstructured":"Hartley, R., & Zisserman, A. (2004). Multiple view geometry in computer vision (2nd ed.). Cambridge University Press.","edition":"2"},{"key":"1804_CR15","doi-asserted-by":"crossref","unstructured":"He, K., Fan, H., Wu, Y., Xie, S., & Girshick, R.\u00a0B. (2020a). Momentum contrast for unsupervised visual representation learning. In CVPR, 9729\u20139738.","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"1804_CR16","doi-asserted-by":"crossref","unstructured":"He, Y., Yan, R., Fragkiadaki, K., & Yu, S.-I. (2020b). Epipolar transformers. In CVPR, 7779\u20137788.","DOI":"10.1109\/CVPR42600.2020.00780"},{"key":"1804_CR17","unstructured":"H\u00e9naff, O. J., Srinivas, A., De Fauw, J., Razavi, A., Doersch, C., Eslami, S. A., & Van Den\u00a0Oord, A. (2020). Data-efficient image recognition with contrastive predictive coding. In ICML, 4182\u20134192."},{"key":"1804_CR18","doi-asserted-by":"publisher","first-page":"1325","DOI":"10.1109\/TPAMI.2013.248","volume":"36","author":"C Ionescu","year":"2014","unstructured":"Ionescu, C., Papava, D., Olaru, V., & Sminchisescu, C. (2014). Human3.6m: Large scale datasets and predictive methods for 3d human sensing in natural environments. TPAMI, 36, 1325\u20131339.","journal-title":"TPAMI"},{"key":"1804_CR19","doi-asserted-by":"crossref","unstructured":"Iqbal, U., Milan, A., & Gall, J. (2017). Posetrack: Joint multi-person pose estimation and tracking. In CVPR, 2011\u20132020.","DOI":"10.1109\/CVPR.2017.495"},{"key":"1804_CR20","unstructured":"Isola, P., Zoran, D., Krishnan, D., & Adelson, E.\u00a0H. (2015). Learning visual groups from co-occurrences in space and time. ArXivarXiv:1511.06811."},{"key":"1804_CR21","doi-asserted-by":"crossref","unstructured":"Kearney, S., Li, W., Parsons, M., Kim, K.\u00a0I., & Cosker, D.\u00a0P. (2020). Rgbd-dog: Predicting canine pose from rgbd sensors. In CVPR, 8336\u20138345.","DOI":"10.1109\/CVPR42600.2020.00836"},{"key":"1804_CR22","unstructured":"Kim, Y., Kim, J.-Y., Joo, K., & Oh, T.-H. (2021). Unified 3D mesh recovery of humans and animals by learning animal exercise. In BMVC."},{"key":"1804_CR23","unstructured":"Kingma, D. P., & Ba, J. (2014). ADAM: A method for stochastic optimization. CoRRarXiv:1412.6980."},{"key":"1804_CR24","doi-asserted-by":"crossref","unstructured":"Kocabas, M., Karagoz, S., & Akbas, E. (2019). Self-supervised learning of 3D human pose using multi-view geometry. In CVPR, 1077\u20131086.","DOI":"10.1109\/CVPR.2019.00117"},{"key":"1804_CR25","doi-asserted-by":"crossref","unstructured":"Kundu, J. N., Seth, S., Jampani, V., Rakesh, M., Babu, R.\u00a0V., & Chakraborty, A. (2020). Self-supervised 3D human pose estimation via part guided novel image synthesis. In CVPR, 6152\u20136162.","DOI":"10.1109\/CVPR42600.2020.00619"},{"key":"1804_CR26","doi-asserted-by":"crossref","unstructured":"Li, S., G\u00fcnel, S., Ostrek, M., Ramdya, P., Fua, P., & Rhodin, H. (2020). Deformation-aware unpaired image translation for pose estimation on laboratory animals. In CVPR, 13158\u201313168.","DOI":"10.1109\/CVPR42600.2020.01317"},{"key":"1804_CR27","doi-asserted-by":"crossref","unstructured":"Liu, B., & Ferrari, V. (2017). Active learning for human pose estimation. In ICCV, 4363\u20134372.","DOI":"10.1109\/ICCV.2017.468"},{"key":"1804_CR28","doi-asserted-by":"crossref","unstructured":"Malisiewicz, T., Gupta, A. K., & Efros, A. A. (2011). Ensemble of exemplar-svms for object detection and beyond. In ICCV, 89\u201396.","DOI":"10.1109\/ICCV.2011.6126229"},{"key":"1804_CR29","doi-asserted-by":"publisher","first-page":"1281","DOI":"10.1038\/s41593-018-0209-y","volume":"21","author":"A Mathis","year":"2018","unstructured":"Mathis, A., Mamidanna, P., Cury, K. M., Abe, T., Murthy, V. N., Mathis, M. W., & Bethge, M. (2018). Deeplabcut: markerless pose estimation of user-defined body parts with deep learning. Nature Neuroscience, 21, 1281\u20131289.","journal-title":"Nature Neuroscience"},{"key":"1804_CR30","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.conb.2019.10.008","volume":"60","author":"MW Mathis","year":"2019","unstructured":"Mathis, M. W., & Mathis, A. (2019). Deep learning tools for the measurement of animal behavior in neuroscience. Current Opinion in Neurobiology, 60, 1\u201311.","journal-title":"Current Opinion in Neurobiology"},{"key":"1804_CR31","doi-asserted-by":"crossref","unstructured":"Newell, A., Yang, K., & Deng, J. (2016). Stacked hourglass networks for human pose estimation. In ECCV, 483\u2013499.","DOI":"10.1007\/978-3-319-46484-8_29"},{"key":"1804_CR32","unstructured":"Paterek, A. (2007). Improving regularized singular value decomposition for collaborative filtering. In KDD cup and Workshop, 5\u20138."},{"key":"1804_CR33","doi-asserted-by":"crossref","unstructured":"Rhodin, H., Salzmann, M., & Fua, P.\u00a0V. (2018). Unsupervised geometry-aware representation learning for 3d human pose estimation. In ECCV, 750\u2013767.","DOI":"10.1007\/978-3-030-01249-6_46"},{"key":"1804_CR34","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1016\/j.imavis.2016.01.002","volume":"47","author":"C Sagonas","year":"2016","unstructured":"Sagonas, C., Antonakos, E., Tzimiropoulos, G., Zafeiriou, S., & Pantic, M. (2016). 300 faces in-the-wild challenge: Database and results. Image and Vision Computing, 47, 3\u201318.","journal-title":"Image and Vision Computing"},{"key":"1804_CR35","unstructured":"Salakhutdinov, R., & Mnih, A. (2007). Probabilistic matrix factorization. NIPS 20."},{"key":"1804_CR36","doi-asserted-by":"crossref","unstructured":"Shrivastava, A., Malisiewicz, T., Gupta, A. K., & Efros, A. A. (2011). Data-driven visual similarity for cross-domain image matching. In: Proceedings of the 2011 SIGGRAPH Asia Conference 30: 154.","DOI":"10.1145\/2024156.2024188"},{"key":"1804_CR37","doi-asserted-by":"crossref","unstructured":"Simon, T., Joo, H., Matthews, I., & Sheikh, Y. (2017). Hand keypoint detection in single images using multiview bootstrapping. In CVPR, 1145\u20131153.","DOI":"10.1109\/CVPR.2017.494"},{"key":"1804_CR38","doi-asserted-by":"crossref","unstructured":"Song, J., Wang, L., Gool, L.\u00a0V., & Hilliges, O. (2017). Thin-slicing network: A deep structured model for pose estimation in videos. In CVPR, 4220\u20134229.","DOI":"10.1109\/CVPR.2017.590"},{"key":"1804_CR39","first-page":"1","volume":"1","author":"O Sorkine-Hornung","year":"2017","unstructured":"Sorkine-Hornung, O., & Rabinovich, M. (2017). Least-squares rigid motion using SVD. Computing, 1, 1\u20135.","journal-title":"Computing"},{"key":"1804_CR40","doi-asserted-by":"crossref","unstructured":"Sun, K., Xiao, B., Liu, D., & Wang, J. (2019). Deep high-resolution representation learning for human pose estimation. In CVPR, 5693\u20135703.","DOI":"10.1109\/CVPR.2019.00584"},{"key":"1804_CR41","doi-asserted-by":"crossref","unstructured":"Tian, Y., Krishnan, D., & Isola, P. (2020). Contrastive multiview coding. In ECCV, 776\u2013794.","DOI":"10.1007\/978-3-030-58621-8_45"},{"key":"1804_CR42","unstructured":"Tompson, J. J., Jain, A., LeCun, Y., & Bregler, C. (2014). Joint training of a convolutional network and a graphical model for human pose estimation. NIPS 27."},{"key":"1804_CR43","doi-asserted-by":"crossref","unstructured":"Toshev, A., & Szegedy, C. (2014). Deeppose: Human pose estimation via deep neural networks. In CVPR, 1653\u20131660.","DOI":"10.1109\/CVPR.2014.214"},{"key":"1804_CR44","unstructured":"Tripathi, S., Ranade, S., Tyagi, A., & Agrawal, A. (2020). Posenet3d: Unsupervised 3d human shape and pose estimation. ArXiv:2003.03473: 14\u201315."},{"key":"1804_CR45","first-page":"67","volume":"170","author":"N Ukita","year":"2018","unstructured":"Ukita, N., & Uematsu, Y. (2018). Semi- and weakly-supervised human pose estimation. CVIU, 170, 67\u201378.","journal-title":"CVIU"},{"key":"1804_CR46","unstructured":"van den Oord, A., Li, Y., & Vinyals, O. (2018). Representation learning with contrastive predictive coding. ArXivarxiv:1807.03748."},{"key":"1804_CR47","doi-asserted-by":"crossref","unstructured":"Wei, S.-E., Ramakrishna, V., Kanade, T., & Sheikh, Y. (2016). Convolutional pose machines. In CVPR, 4724\u20134732.","DOI":"10.1109\/CVPR.2016.511"},{"key":"1804_CR48","doi-asserted-by":"crossref","unstructured":"Wu, Z., Xiong, Y., Yu, S. X., & Lin, D. (2018). Unsupervised feature learning via non-parametric instance discrimination. In CVPR, 3733\u20133742.","DOI":"10.1109\/CVPR.2018.00393"},{"key":"1804_CR49","doi-asserted-by":"crossref","unstructured":"Yao, Y., Jafarian, Y., & Park, H. S. (2019). Monet: Multiview semi-supervised keypoint detection via epipolar divergence. In ICCV, 753\u2013762.","DOI":"10.1109\/ICCV.2019.00084"},{"key":"1804_CR50","doi-asserted-by":"crossref","unstructured":"Zuffi, S., Kanazawa, A., Jacobs, D. W., & Black, M.\u00a0J. (2017). 3d menagerie: Modeling the 3d shape and pose of animals. In CVPR, 6365\u20136373.","DOI":"10.1109\/CVPR.2017.586"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01804-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-023-01804-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01804-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,7,17]],"date-time":"2023-07-17T07:15:39Z","timestamp":1689578139000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-023-01804-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,6,1]]},"references-count":50,"journal-issue":{"issue":"8","published-print":{"date-parts":[[2023,8]]}},"alternative-id":["1804"],"URL":"https:\/\/doi.org\/10.1007\/s11263-023-01804-y","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,6,1]]},"assertion":[{"value":"27 April 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 April 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 June 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no conflicts of interest; All procedures were performed in compliance with the guidelines of the IACUC of the University of Minnesota; Informed consent is not relevant because there were no human subjects.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}