{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,26]],"date-time":"2026-06-26T01:24:26Z","timestamp":1782437066061,"version":"3.54.5"},"reference-count":250,"publisher":"Tsinghua University Press","issue":"3","funder":[{"DOI":"10.13039\/100002224","name":"MRF","doi-asserted-by":"publisher","award":["CHU-24003"],"award-info":[{"award-number":["CHU-24003"]}],"id":[{"id":"10.13039\/100002224","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001459","name":"Ministry of Education, Singapore","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001459","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Comp. Visual. Med."],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.26599\/cvm.2025.9450514","type":"journal-article","created":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T19:48:41Z","timestamp":1776887321000},"page":"509-573","source":"Crossref","is-referenced-by-count":3,"title":["Self-Supervised Learning for Pre-Training 3D Point Clouds: A Survey"],"prefix":"10.26599","volume":"12","author":[{"given":"Ben","family":"Fei","sequence":"first","affiliation":[{"name":"The Chinese University of Hong Kong,Department of Information Engineering,Hong Kong,China,999077"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jingyi","family":"Xu","sequence":"additional","affiliation":[{"name":"School of Computer Science, Fudan University,Shanghai,China,200433"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yixuan","family":"Li","sequence":"additional","affiliation":[{"name":"School of Computer Science, Fudan University,Shanghai,China,200433"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Weidong","family":"Yang","sequence":"additional","affiliation":[{"name":"School of Computer Science, Fudan University,Shanghai,China,200433"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qingyuan","family":"Zhou","sequence":"additional","affiliation":[{"name":"School of Computer Science, Fudan University,Shanghai,China,200433"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Liwen","family":"Liu","sequence":"additional","affiliation":[{"name":"School of Computer Science, Fudan University,Shanghai,China,200433"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tianyue","family":"Luo","sequence":"additional","affiliation":[{"name":"School of Computer Science, Fudan University,Shanghai,China,200433"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ying","family":"He","sequence":"additional","affiliation":[{"name":"College of Computing and Data Science, Nanyang Technological University,Singapore,Singapore,639798"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"11138","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3262786"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2020.3023541"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2024.3521854"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2024.3397828"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3005434"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TAI.2025.3527922"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3548181"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2024.3406587"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i10.33178"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00599"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2023.3321458"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3286981"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2025.3559340"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3340892"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2024.3459018"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00167"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2017.261"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298801"},{"key":"ref19","article-title":"ShapeNet: An information-rich 3D model repository","author":"Chang","year":"2015","journal-title":"arXiv preprint"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298655"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6248074"},{"key":"ref22","volume-title":"Lyft level 5 av dataset","author":"Kesten","year":"2019"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00252"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01164"},{"key":"ref25","article-title":"One million scenes for autonomous driving: ONCE dataset","author":"Mao","year":"2021","journal-title":"arXiv preprint"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.170"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00939"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1177\/02783649211006735"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/3DV53792.2021.00022"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.264"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2025.3560297"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.01474"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1452"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1907.11692"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.278"},{"key":"ref36","article-title":"BEiT: BERT pretraining of image transformers","author":"Bao","year":"2021","journal-title":"arXiv preprint"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01553"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.00943"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20086-1_38"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.00964"},{"key":"ref41","article-title":"Masked surfel prediction for self-supervised point cloud learning","author":"Zhang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01871"},{"key":"ref43","article-title":"Point-McBert: A multi-choice self-supervised framework for point cloud pretraining","author":"Fu","year":"2022","journal-title":"arXiv preprint"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3224370"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3314973"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20086-1_35"},{"key":"ref47","article-title":"Point-M2AE: Multi-scale masked autoencoders for hierarchical point cloud pretraining","author":"Zhang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01532"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3317998"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00119"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2024.3382512"},{"key":"ref52","article-title":"SeRP: Self-supervised representation learning using perturbed point clouds","author":"Garg","year":"2022","journal-title":"arXiv preprint"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.16"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00827"},{"key":"ref55","article-title":"Point-DAE: Denoising autoencoders for self-supervised point cloud learning","author":"Zhang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref56","article-title":"Self-supervised deep learning on point clouds by reconstructing space","author":"Sauder","year":"2019","journal-title":"arXiv preprint"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00017"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00375"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICAACE61206.2024.10548311"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01336"},{"key":"ref61","article-title":"Deconstructing denoising diffusion models for self-supervised learning","author":"Chen","year":"2024","journal-title":"arXiv preprint"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2023\/762"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01557"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01701"},{"key":"ref65","article-title":"Representation learning with contrastive predictive coding","author":"Van Den Oord","year":"2018","journal-title":"arXiv preprint"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3059923"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58545-7_19"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW53098.2021.00084"},{"key":"ref70","article-title":"ContraGAN: Contrastive learning for conditional image generation","author":"Kang","year":"2020","journal-title":"arXiv preprint"},{"key":"ref71","first-page":"12546","article-title":"Contrastive learning of global and local features for medical image segmentation with limited annotations","volume-title":"Proceedings of the 34th International Conference on Neural Information Processing Systems","author":"Chaitanya","year":"2020"},{"key":"ref72","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","volume-title":"Proceedings of the 37th International Conference on Machine Learning","author":"Chen","year":"2020"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58580-8_34"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01009"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00905"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00908"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01533"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20056-4_38"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW54120.2021.00105"},{"key":"ref80","article-title":"Attention is all you need","volume-title":"Proceedings of the 31st Conference on Neural Information Processing Systems","author":"Vaswani","year":"2017"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.122563"},{"key":"ref82","article-title":"Distillation with contrast is all you need for self-supervised point cloud representation learning","author":"Fu","year":"2022","journal-title":"arXiv preprint"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01549"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/icip46576.2022.9897388"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19824-3_32"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00724"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01449"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02086"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20056-4_23"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.naacl-main.311"},{"key":"ref91","article-title":"Graph contrastive learning with augmentations","author":"You","year":"2020","journal-title":"arXiv preprint"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3371473"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_14"},{"key":"ref94","article-title":"ParaNet: Deep regular representation for 3D point clouds","author":"Zhang","year":"2020","journal-title":"arXiv preprint"},{"key":"ref95","article-title":"Unsupervised representation learning by predicting image rotations","author":"Gidaris","year":"2018","journal-title":"arXiv preprint"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_9"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.167"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00156"},{"key":"ref99","article-title":"Using selfsupervised learning can improve model robustness and uncertainty","author":"Hendrycks","year":"2019","journal-title":"arXiv preprint"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00647"},{"key":"ref101","article-title":"Canonical capsules: Self-supervised capsules in canonical pose","author":"Sun","year":"2020","journal-title":"arXiv preprint"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/3DV50981.2020.00112"},{"key":"ref103","first-page":"15498","article-title":"Adversarially robust 3D point cloud recognition using self-supervisions","volume-title":"Proceedings of the 35th International Conference on Neural Information Processing Systems","author":"Sun","year":"2021"},{"key":"ref104","article-title":"SL3D: Self-supervised-self-labeled 3D recognition","author":"Cendra","year":"2022","journal-title":"arXiv preprint"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.00825"},{"key":"ref106","first-page":"7212","article-title":"Self-supervised few-shot learning on point clouds","volume-title":"Proceedings of the 34th International Conference on Neural Information Processing Systems","author":"Sharma","year":"2020"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3159794"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-18913-5_7"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.02060"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00815"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3244828"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01682-w"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73202-7_16"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2024.106350"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00991"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3052951"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3415112"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46448-0_32"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00689"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00123"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01514"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.01520"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01694"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1145\/3577925"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2023.3344935"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3421359"},{"key":"ref127","article-title":"Voint cloud: Multi-view point cloud representation for 3D understanding","author":"Hamdi","year":"2021","journal-title":"arXiv preprint"},{"key":"ref128","volume-title":"Improving language understanding by generative pretraining","author":"Radford","year":"2018"},{"key":"ref129","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","author":"Jia","year":"2021","journal-title":"arXiv preprint"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49660.2025.10888910"},{"key":"ref131","article-title":"Towards unified representation of multimodal pretraining for 3D understanding via differentiable rendering","author":"Fei","year":"2024","journal-title":"arXiv preprint"},{"key":"ref132","article-title":"Self-supervised pretraining of 3D point cloud networks with image data","author":"Janda","year":"2022","journal-title":"arXiv preprint"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3206664"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1007\/s00530-024-01335-7"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00512"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.00519"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW53098.2021.00174"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-26319-4_25"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00265"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1145\/3597613"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2023.3345353"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00967"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3284591"},{"key":"ref144","article-title":"Autoencoders as cross-modal teachers: Can pretrained 2D image transformers help 3D representation learning?","author":"Dong","year":"2022","journal-title":"arXiv preprint"},{"key":"ref145","article-title":"P2P: Tuning pretrained image models for point cloud analysis with point-to-pixel prompting","author":"Wang","year":"2022","journal-title":"arXiv preprint"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.02085"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1109\/3dv62453.2024.00113"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1291"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.52202\/075280-3467"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72698-9_8"},{"key":"ref152","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021","journal-title":"arXiv preprint"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00836"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.00249"},{"key":"ref156","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proceedings of the 32th International Conference on Neural Information Processing Systems","author":"Brown","year":"2020"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i3.28013"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00120"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW60793.2023.00217"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_30"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3429301"},{"key":"ref162","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2021.3090866"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00075"},{"key":"ref164","article-title":"RGB-based semantic segmentation using self-supervised depth pretraining","author":"Lahoud","year":"2020","journal-title":"arXiv preprint"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3142440"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19842-7_2"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1109\/TIV.2023.3322409"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1109\/wacvw58289.2023.00039"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1109\/WACV57701.2024.00335"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01304"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01292"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00907"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1109\/ICME52920.2022.9860015"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.3390\/math10193549"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01293"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00459"},{"key":"ref177","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2024.3495045"},{"key":"ref178","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i4.28141"},{"key":"ref179","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00890"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00378"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.223"},{"key":"ref182","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00328"},{"key":"ref183","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i2.20040"},{"key":"ref184","article-title":"CO3: Cooperative unsupervised 3D representation learning for autonomous driving","author":"Chen","year":"2022","journal-title":"arXiv preprint"},{"key":"ref185","doi-asserted-by":"publisher","DOI":"10.1109\/ITSC55140.2022.9922494"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19803-8_33"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.02007"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1109\/3DV62453.2024.00012"},{"key":"ref189","first-page":"30826","article-title":"Transferring pretrained multimodal representations with cross-modal similarity matching","volume-title":"Proceedings of the 34th International Conference on Neural Information Processing Systems","author":"Kim","year":"2022"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00470"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1109\/IROS58592.2024.10802675"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01327"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00116"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00966"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.52202\/079017-4078"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-026-02879-z"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2025.3584625"},{"key":"ref198","doi-asserted-by":"publisher","DOI":"10.1145\/3696661"},{"key":"ref199","article-title":"Deep multi-scale video prediction beyond mean square error","author":"Mathieu","year":"2015","journal-title":"arXiv preprint"},{"key":"ref200","article-title":"Beyond just vision: A review on self-supervised representation learning on multimodal and temporal data","author":"Deldari","year":"2022","journal-title":"arXiv preprint"},{"key":"ref201","article-title":"Inverting the pose forecasting pipeline with SPF2: Sequential pointcloud forecasting for sequential pose forecasting","author":"Weng","year":"2020","journal-title":"arXiv preprint"},{"key":"ref202","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2021.3128424"},{"key":"ref203","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460874"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2019.8793490"},{"key":"ref205","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01140"},{"key":"ref206","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48506.2021.9561940"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW50498.2020.00477"},{"key":"ref208","first-page":"1444","article-title":"Self-supervised point cloud prediction using 3D spatiotemporal convolutional networks","volume-title":"Proceedings of the 5th Conference on Robot Learning","author":"Mersch","year":"2022"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1109\/TIE.2022.3229385"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3130536"},{"key":"ref211","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3265280"},{"key":"ref212","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i8.26170"},{"key":"ref213","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3492289"},{"key":"ref214","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.281"},{"key":"ref215","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01092"},{"key":"ref216","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00062"},{"key":"ref217","article-title":"Just go with the flow: Selfsupervised scene flow estimation","author":"Mittal","year":"2019","journal-title":"arXiv preprint"},{"key":"ref218","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01532"},{"key":"ref219","article-title":"Near-linear time approximation algorithms for optimal transport via Sinkhorn iteration","volume-title":"arXiv preprint","author":"Altschuler","year":"2017"},{"key":"ref220","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01288"},{"key":"ref221","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00410"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1109\/3DV50981.2020.00036"},{"key":"ref223","doi-asserted-by":"publisher","DOI":"10.1109\/3DV50981.2020.00025"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58558-7_6"},{"key":"ref225","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01645"},{"key":"ref226","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00510"},{"key":"ref227","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00631"},{"key":"ref228","doi-asserted-by":"publisher","DOI":"10.1109\/IVS.2019.8814146"},{"key":"ref229","doi-asserted-by":"publisher","DOI":"10.1109\/3DV53792.2021.00087"},{"key":"ref230","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3215019"},{"key":"ref231","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20080-9_15"},{"key":"ref232","doi-asserted-by":"publisher","DOI":"10.52202\/068431-2233"},{"key":"ref233","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00505"},{"key":"ref234","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01329"},{"key":"ref235","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.00789"},{"key":"ref236","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00709"},{"key":"ref237","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.14795"},{"key":"ref238","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2023.3264102"},{"key":"ref239","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01173"},{"key":"ref240","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01023"},{"key":"ref241","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3216606"},{"key":"ref242","doi-asserted-by":"publisher","DOI":"10.1109\/IV51971.2022.9827295"},{"key":"ref243","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2025.3594478"},{"key":"ref244","article-title":"Point-E: A system for generating 3D point clouds from complex prompts","author":"Nichol","year":"2022","journal-title":"arXiv preprint"},{"key":"ref245","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2021.3109392"},{"key":"ref246","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00110"},{"key":"ref247","article-title":"Scalable 3D captioning with pretrained models","author":"Luo","year":"2023","journal-title":"arXiv preprint"},{"key":"ref248","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01263"},{"key":"ref249","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48891.2023.10160968"},{"key":"ref250","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.121354"}],"container-title":["Computational Visual Media"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10750449\/11534440\/11493603.pdf?arnumber=11493603","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,25]],"date-time":"2026-05-25T19:53:09Z","timestamp":1779738789000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11493603\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":250,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.26599\/cvm.2025.9450514","relation":{},"ISSN":["2096-0662","2096-0433"],"issn-type":[{"value":"2096-0662","type":"electronic"},{"value":"2096-0433","type":"print"}],"subject":[],"published":{"date-parts":[[2026,6]]}}}