{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T16:54:11Z","timestamp":1777654451884,"version":"3.51.4"},"reference-count":94,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"7","license":[{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2023YFF0905104"],"award-info":[{"award-number":["2023YFF0905104"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62376244"],"award-info":[{"award-number":["62376244"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Circuits Syst. Video Technol."],"published-print":{"date-parts":[[2025,7]]},"DOI":"10.1109\/tcsvt.2025.3543384","type":"journal-article","created":{"date-parts":[[2025,2,18]],"date-time":"2025-02-18T18:26:51Z","timestamp":1739903211000},"page":"6386-6398","source":"Crossref","is-referenced-by-count":1,"title":["LPM: Efficient 3D Content Creation From Single Image by Large-Scale Partial 3D Modeling"],"prefix":"10.1109","volume":"35","author":[{"given":"Yisu","family":"Zhang","sequence":"first","affiliation":[{"name":"College of Computer Science and Technology, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7852-4491","authenticated-orcid":false,"given":"Chaohui","family":"Yu","sequence":"additional","affiliation":[{"name":"Alibaba Damo Academy, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7320-1119","authenticated-orcid":false,"given":"Fan","family":"Wang","sequence":"additional","affiliation":[{"name":"Alibaba Damo Academy, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1831-0106","authenticated-orcid":false,"given":"Jianke","family":"Zhu","sequence":"additional","affiliation":[{"name":"College of Computer Science and Technology, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00025"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00455"},{"key":"ref3","first-page":"1","article-title":"Disn: Deep implicit surface network for high-quality single-view 3D reconstruction","volume-title":"Proc. NeurIPS","author":"Xu"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00433"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref6","first-page":"8821","article-title":"Zero-shot text-to-image generation","volume-title":"Proc. Int. Conf. Mach. Learn. (ICML)","author":"Ramesh"},{"key":"ref7","article-title":"DreamFusion: Text-to-3D using 2D diffusion","author":"Poole","year":"2022","journal-title":"arXiv:2209.14988"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00037"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612232"},{"key":"ref10","article-title":"DreamGaussian: Generative Gaussian splatting for efficient 3D content creation","author":"Tang","year":"2023","journal-title":"arXiv:2309.16653"},{"key":"ref11","article-title":"DreamCraft3D: Hierarchical 3D generation with bootstrapped diffusion prior","author":"Sun","year":"2023","journal-title":"arXiv:2310.16818"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02033"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02086"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00853"},{"key":"ref15","article-title":"MVDream: Multi-view diffusion for 3D generation","author":"Shi","year":"2023","journal-title":"arXiv:2308.16512"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00389"},{"key":"ref17","article-title":"Consistent-1-to-3: Consistent image to 3D view synthesis via geometry-aware diffusion models","author":"Ye","year":"2023","journal-title":"arXiv:2310.03020"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2019.2940647"},{"key":"ref19","article-title":"LRM: Large reconstruction model for single image to 3D","author":"Hong","year":"2023","journal-title":"arXiv:2311.04400"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01263"},{"key":"ref21","article-title":"Objaverse-XL: A universe of 10M+ 3D objects","author":"Deitke","year":"2023","journal-title":"arXiv:2307.05663"},{"key":"ref22","article-title":"DMV3D: Denoising multi-view diffusion using 3D large reconstruction model","author":"Xu","year":"2023","journal-title":"arXiv:2311.09217"},{"key":"ref23","article-title":"PF-LRM: Pose-free large reconstruction model for joint pose and shape prediction","author":"Wang","year":"2023","journal-title":"arXiv:2311.12024"},{"key":"ref24","article-title":"Instant3D: Fast text-to-3D with sparse-view generation and large reconstruction model","author":"Li","year":"2023","journal-title":"arXiv:2311.06214"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58452-8_24"},{"key":"ref26","article-title":"Triplane meets Gaussian splatting: Fast and generalizable single-view 3D reconstruction with transformers","author":"Zou","year":"2023","journal-title":"arXiv:2312.09147"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00875"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01871"},{"key":"ref30","article-title":"Dinov2: Learning robust visual features without supervision","author":"Oquab","year":"2023","journal-title":"arXiv:2304.07193"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3019967"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.264"},{"key":"ref33","first-page":"1","article-title":"NU-MCC: Multiview compressive coding with neighborhood decoder and repulsive UDF","volume-title":"Proc. NeurIPS","author":"Lionar"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46466-4_29"},{"key":"ref35","first-page":"1","article-title":"Marrnet: 3D shape reconstruction via 2.5 D sketches","volume-title":"Proc. NeruIPS","author":"Wu"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00988"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3472036"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00133"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00780"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00459"},{"key":"ref41","article-title":"ShapeNet: An information-rich 3D model repository","author":"Chang","year":"2015","journal-title":"arXiv:1512.03012"},{"key":"ref42","first-page":"1","article-title":"Michelangelo: Conditional 3D shape generation based on shape-image-text aligned latent representation","volume-title":"Proc. NeurIPS","author":"Zhao"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2020.3040900"},{"key":"ref44","article-title":"Wonder3D: Single image to 3D using cross-domain diffusion","author":"Long","year":"2023","journal-title":"arXiv:2310.15008"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3478740"},{"key":"ref46","article-title":"Unique3D: High-quality and efficient 3D mesh generation from a single image","author":"Wu","year":"2024","journal-title":"arXiv:2405.20343"},{"key":"ref47","article-title":"Point-E: A system for generating 3D point clouds from complex prompts","author":"Nichol","year":"2022","journal-title":"arXiv:2212.08751"},{"key":"ref48","article-title":"Shap-E: Generating conditional 3D implicit functions","author":"Jun","year":"2023","journal-title":"arXiv:2305.02463"},{"key":"ref49","article-title":"MeshDiffusion: Score-based generative 3D mesh modeling","author":"Liu","year":"2023","journal-title":"arXiv:2303.08133"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00421"},{"key":"ref51","article-title":"PrimDiffusion: Volumetric primitives diffusion for 3D human generation","author":"Chen","year":"2023","journal-title":"arXiv:2312.04559"},{"key":"ref52","article-title":"Text-to-3D using Gaussian splatting","author":"Chen","year":"2023","journal-title":"arXiv:2309.16585"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/3dv62453.2024.00154"},{"key":"ref54","article-title":"ProlificDreamer: High-fidelity and diverse text-to-3D generation with variational score distillation","author":"Wang","year":"2023","journal-title":"arXiv:2305.16213"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i4.28113"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i2.27886"},{"key":"ref57","article-title":"SweetDreamer: Aligning geometric priors in 2D diffusion for consistent text-to-3D","author":"Li","year":"2023","journal-title":"arXiv:2310.02596"},{"key":"ref58","first-page":"1","article-title":"Deep marching tetrahedra: A hybrid representation for high-resolution 3D shape synthesis","volume-title":"Proc. NeurIPS","author":"Shen"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01565"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.02000"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00229"},{"key":"ref62","article-title":"Large-vocabulary 3D diffusion model with transformer","author":"Cao","year":"2023","journal-title":"arXiv:2309.07920"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73235-5_1"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72633-0_1"},{"key":"ref65","article-title":"InstantMesh: Efficient 3D mesh generation from a single image with sparse-view large reconstruction models","author":"Xu","year":"2024","journal-title":"arXiv:2404.07191"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72751-1_4"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i7.32787"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3443417"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1145\/3592433"},{"issue":"12","key":"ref70","first-page":"3371","article-title":"Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion","volume":"11","author":"Vincent","year":"2010","journal-title":"JMLR"},{"key":"ref71","first-page":"1","article-title":"Autoencoders, minimum description length and Helmholtz free energy","volume-title":"Proc. NeurIPS","author":"Hinton"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.278"},{"key":"ref73","article-title":"An image is worth 16\u00d716 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020","journal-title":"arXiv:2010.11929"},{"key":"ref74","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018","journal-title":"arXiv:1810.04805"},{"key":"ref75","first-page":"1691","article-title":"Generative pretraining from pixels","volume-title":"Proc. ICML","author":"Chen"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01426"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.106"},{"key":"ref78","first-page":"1","article-title":"Mvsformer: Multi-view stereo by learning robust image features and temperature-based depth","author":"Cao","year":"2022","journal-title":"Proc. Trans. Mach. Learn."},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00323"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00068"},{"key":"ref81","volume-title":"Blender-A 3D Modelling and Rendering Package","year":"2018"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9811809"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.02045"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2003.819861"},{"key":"ref85","volume-title":"Openlrm: Open-Source Large Reconstruction Models","author":"He","year":"2023"},{"key":"ref86","article-title":"Zero123++: A single image to consistent multi-view diffusion base model","author":"Shi","year":"2023","journal-title":"arXiv:2310.15110"},{"key":"ref87","article-title":"TripoSR: Fast 3D object reconstruction from a single image","author":"Tochilkin","year":"2024","journal-title":"arXiv:2403.02151"},{"key":"ref88","article-title":"Adam: A method for stochastic optimization","author":"Kingma","year":"2014","journal-title":"arXiv:1412.6980"},{"key":"ref89","article-title":"SGDR: Stochastic gradient descent with warm restarts","author":"Loshchilov","year":"2016","journal-title":"arXiv:1608.03983"},{"key":"ref90","first-page":"1","article-title":"One-2\u20133\u201345: Any single image to 3D mesh in 45 seconds without per-shape optimization","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"36","author":"Liu"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1145\/280811.281026"},{"key":"ref92","first-page":"1","article-title":"Poisson surface reconstruction","volume-title":"Proc. SGP","author":"Kazhdan"},{"key":"ref93","article-title":"One-2\u20133\u201345++: Fast single image to 3D objects with consistent multi-view generation and 3D diffusion","author":"Liu","year":"2023","journal-title":"arXiv:2311.07885"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i2.25233"}],"container-title":["IEEE Transactions on Circuits and Systems for Video Technology"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/76\/11071401\/10891871.pdf?arnumber=10891871","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,5]],"date-time":"2025-07-05T04:32:09Z","timestamp":1751689929000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10891871\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7]]},"references-count":94,"journal-issue":{"issue":"7"},"URL":"https:\/\/doi.org\/10.1109\/tcsvt.2025.3543384","relation":{},"ISSN":["1051-8215","1558-2205"],"issn-type":[{"value":"1051-8215","type":"print"},{"value":"1558-2205","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,7]]}}}