{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,24]],"date-time":"2026-06-24T16:19:39Z","timestamp":1782317979422,"version":"3.54.5"},"reference-count":102,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccv51701.2025.00551","type":"proceedings-article","created":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:45:49Z","timestamp":1777491949000},"page":"5821-5833","source":"Crossref","is-referenced-by-count":2,"title":["Real3D: Towards Scaling Large Reconstruction Models with Real Images"],"prefix":"10.1109","author":[{"given":"Hanwen","family":"Jiang","sequence":"first","affiliation":[{"name":"The University of Texas at Austin"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qixing","family":"Huang","sequence":"additional","affiliation":[{"name":"The University of Texas at Austin"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Georgios","family":"Pavlakos","sequence":"additional","affiliation":[{"name":"The University of Texas at Austin"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.00375"},{"key":"ref2","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00574"},{"key":"ref4","first-page":"16123","article-title":"Efficient geometry-aware 3d generative adversarial networks","volume-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","author":"Eric","year":"2022"},{"key":"ref5","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","volume-title":"International conference on machine learning","author":"Chen","year":"2020"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01549"},{"key":"ref7","article-title":"Languageconditioned detection transformer","author":"Hyun Cho","year":"2023","journal-title":"arXiv preprint"},{"key":"ref8","first-page":"628","article-title":"3d-r2n2: A unified approach for single and multi-view 3d object reconstruction","volume-title":"Computer Vision-ECCV 2016: 14th European Conference","author":"Christopher","year":"2016"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01263"},{"key":"ref10","first-page":"36","article-title":"Objaverse-xl: A universe of $10 ~\\mathrm{m}+3 ~\\mathrm{d}$ objects","author":"Deitke","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01977"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00159"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.264"},{"key":"ref15","article-title":"An image is worth one word: Personalizing text-toimage generation using textual inversion","author":"Gal","year":"2022","journal-title":"arXiv preprint"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00988"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.5555\/3495724.3497510"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72627-9_19"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"ref20","author":"He","year":"2023","journal-title":"Openlrm: Open-source large reconstruction models"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00752"},{"key":"ref22","first-page":"30","article-title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","author":"Heusel","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref23","article-title":"Lrm: Large reconstruction model for single image to 3d","author":"Hong","year":"2023","journal-title":"arXiv preprint"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00594"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00959"},{"key":"ref26","article-title":"Leap: Liberate sparse-view 3d modeling from camera poses","author":"Jiang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/3DV62453.2024.00055"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.00468"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01533"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01237-3_49"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.52202\/068431-0203"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01267-0_23"},{"key":"ref33","article-title":"Scaling laws for neural language models","author":"Kaplan","year":"2020","journal-title":"arXiv preprint"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298807"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1145\/3592433"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00053"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-020-01316-z"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58568-6_40"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19769-7_30"},{"key":"ref41","first-page":"11453","article-title":"Sdfsrn: Learning signed distance 3d object reconstruction from static images","volume":"33","author":"Lin","year":"2020","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00853"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00780"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01445"},{"key":"ref45","article-title":"Syncdreamer: Generating multiview-consistent images from a single-view image","author":"Liu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00951"},{"key":"ref47","article-title":"Decoupled weight decay regularization","author":"Loshchilov","year":"2017","journal-title":"arXiv preprint"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00816"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00459"},{"key":"ref50","article-title":"im2nerf: Image to neural radiance field in the wild","author":"Mi","year":"2022","journal-title":"arXiv preprint"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1145\/3306346.3322980"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1145\/3503250"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19769-7_17"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00121"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00768"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00025"},{"key":"ref57","article-title":"Dreamfusion: Text-to-3d using 2d diffusion","author":"Poole","year":"2022","journal-title":"arXiv preprint"},{"key":"ref58","article-title":"Magic123: One image to high-quality 3d object generation using both 2d and 3d diffusion priors","author":"Qian","year":"2023","journal-title":"arXiv preprint"},{"key":"ref59","article-title":"Richdreamer: A generalizable normal-depth diffusion model for detail richness in text-to3d","author":"Qiu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref60","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"International conference on machine learning","author":"Radford","year":"2021"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00433"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01072"},{"key":"ref63","article-title":"Sharf: Shape-conditioned radiance fields from a single view","author":"Rematas","year":"2021","journal-title":"arXiv preprint"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00391"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1833"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.1965.1053799"},{"key":"ref68","article-title":"Mvdream: Multi-view diffusion for 3d generation","author":"Shi","year":"2023","journal-title":"arXiv preprint"},{"key":"ref69","first-page":"32","article-title":"Scene representation networks: Continuous 3d-structureaware neural scene representations","author":"Sitzmann","year":"2019","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref70","article-title":"3d generation on imagenet","author":"Skorokhodov","year":"2023","journal-title":"arXiv preprint"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00972"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02086"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73235-5_1"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1145\/2812802"},{"key":"ref75","article-title":"Triposr: Fast 3d object reconstruction from a single image","author":"Tochilkin","year":"2024","journal-title":"arXiv preprint"},{"key":"ref76","article-title":"Llama: Open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arXiv preprint"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00063"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.30"},{"key":"ref79","first-page":"30","article-title":"Neural discrete representation learning","author":"Van Den Oord","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73232-4_25"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2003.819861"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72751-1_4"},{"key":"ref84","article-title":"Meshlrm: Large reconstruction model for highquality mesh","author":"Wei","year":"2024","journal-title":"arXiv preprint"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00875"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00008"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00084"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00226"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01070"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20047-2_42"},{"key":"ref91","article-title":"Instantmesh: Efficient 3d mesh generation from a single image with sparse-view large reconstruction models","author":"Xu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72633-0_1"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01023"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00987"},{"key":"ref95","article-title":"Depth anything v2","author":"Yang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.00873"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00455"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00883"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72670-5_1"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00068"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01245"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00983"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision (ICCV)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,25]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision (ICCV)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11443115\/11443287\/11444596.pdf?arnumber=11444596","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T06:12:24Z","timestamp":1777529544000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11444596\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":102,"URL":"https:\/\/doi.org\/10.1109\/iccv51701.2025.00551","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}