{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T08:17:32Z","timestamp":1783066652711,"version":"3.54.6"},"reference-count":88,"publisher":"Association for Computing Machinery (ACM)","issue":"4","license":[{"start":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T00:00:00Z","timestamp":1783036800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["62132001"],"award-info":[{"award-number":["62132001"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":["ACM Trans. Graph."],"published-print":{"date-parts":[[2026,7,3]]},"abstract":"<jats:p>\n                    We introduce\n                    <jats:italic toggle=\"yes\">SegviGen<\/jats:italic>\n                    , a framework that repurposes native 3D generative models for 3D part segmentation. Existing pipelines either lift strong 2D priors into 3D via distillation or multi-view mask aggregation, often suffering from cross-view inconsistency and blurred boundaries, or explore native 3D discriminative segmentation, which typically requires large-scale annotated 3D data and substantial training resources. In contrast,\n                    <jats:italic toggle=\"yes\">SegviGen<\/jats:italic>\n                    leverages the structured priors encoded in pretrained 3D generative model to induce segmentation through distinctive part colorization, establishing a novel and efficient framework for part segmentation. Specifically,\n                    <jats:italic toggle=\"yes\">SegviGen<\/jats:italic>\n                    encodes an input 3D asset and predicts part-indicative colors on active voxels of a geometry-aligned reconstruction. It supports interactive part segmentation, full segmentation, and full segmentation with 2D guidance in a unified framework. Extensive experiments show that\n                    <jats:bold>\n                      <jats:italic toggle=\"yes\">SegviGen<\/jats:italic>\n                      improves over the prior state of the art by 40% on interactive part segmentation and by 15% on full segmentation, while using only 0.32% of the training data.\n                    <\/jats:bold>\n                    This undoubtedly demonstrates that pretrained 3D generative priors transfer effectively to 3D part segmentation, enabling strong performance with limited supervision. Code and pretrained weights are publicly available at https:\/\/github.com\/Nelipot-Lee\/SegviGen.\n                  <\/jats:p>","DOI":"10.1145\/3811399","type":"journal-article","created":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T07:05:51Z","timestamp":1783062351000},"page":"1-12","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["SegviGen: Repurposing 3D Generative Model for Part Segmentation"],"prefix":"10.1145","volume":"45","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-3113-416X","authenticated-orcid":false,"given":"Lin","family":"Li","sequence":"first","affiliation":[{"name":"Renmin University of China, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-0770-361X","authenticated-orcid":false,"given":"Haoran","family":"Feng","sequence":"additional","affiliation":[{"name":"Tsinghua University, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-1883-0777","authenticated-orcid":false,"given":"Zehuan","family":"Huang","sequence":"additional","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-4631-0172","authenticated-orcid":false,"given":"Haohua","family":"Chen","sequence":"additional","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-7268-994X","authenticated-orcid":false,"given":"Wenbo","family":"Nie","sequence":"additional","affiliation":[{"name":"Beijing Jiaotong University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-1172-940X","authenticated-orcid":false,"given":"Shaohua","family":"Hou","sequence":"additional","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-1032-2971","authenticated-orcid":false,"given":"Keqing","family":"Fan","sequence":"additional","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-8151-2279","authenticated-orcid":false,"given":"Pan","family":"Hu","sequence":"additional","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-1182-2453","authenticated-orcid":false,"given":"Sheng","family":"Wang","sequence":"additional","affiliation":[{"name":"Bambu Lab, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5442-4667","authenticated-orcid":false,"given":"Buyu","family":"Li","sequence":"additional","affiliation":[{"name":"Bambu Lab, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8525-9163","authenticated-orcid":false,"given":"Lu","family":"Sheng","sequence":"additional","affiliation":[{"name":"School of Software, Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,7,3]]},"reference":[{"key":"e_1_2_1_1_1","volume-title":"Haitham Khedr, Andrew Huang, et al.","author":"Carion Nicolas","year":"2025","unstructured":"Nicolas Carion, Laura Gustafson, Yuan-Ting Hu, Shoubhik Debnath, Ronghang Hu, Didac Suris, Chaitanya Ryali, Kalyan Vasudev Alwala, Haitham Khedr, Andrew Huang, et al. 2025. Sam 3: Segment anything with concepts. arXiv preprint arXiv:2511.16719 (2025)."},{"key":"e_1_2_1_2_1","doi-asserted-by":"crossref","unstructured":"Mathilde Caron Hugo Touvron Ishan Misra Herv\u00e9 J\u00e9gou Julien Mairal Piotr Bojanowski and Armand Joulin. 2021. Emerging Properties in Self-Supervised Vision Transformers. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"e_1_2_1_3_1","doi-asserted-by":"crossref","unstructured":"Sijin Chen Xin Chen Anqi Pang Xianfang Zeng Wei Cheng Yijun Fu Fukun Yin Yanru Wang Zhibin Wang Chi Zhang Jingyi Yu Gang Yu Bin Fu and Tao Chen. 2024a. MeshXL: Neural Coordinate Field for Generative 3D Foundation Models. arXiv:2405.20853 [cs.CV] https:\/\/arxiv.org\/abs\/2405.20853","DOI":"10.52202\/079017-3080"},{"key":"e_1_2_1_4_1","doi-asserted-by":"crossref","unstructured":"Xiaobai Chen Aleksey Golovinskiy and Thomas Funkhouser. 2009. A Benchmark for 3D Mesh Segmentation. In SIGGRAPH.","DOI":"10.1145\/1576246.1531379"},{"key":"e_1_2_1_5_1","unstructured":"Yiwen Chen Tong He Di Huang Weicai Ye Sijin Chen Jiaxiang Tang Xin Chen Zhongang Cai Lei Yang Gang Yu Guosheng Lin and Chi Zhang. 2024b. MeshAnything: Artist-Created Mesh Generation with Autoregressive Transformers. arXiv:2406.10163 [cs.CV] https:\/\/arxiv.org\/abs\/2406.10163"},{"key":"e_1_2_1_6_1","unstructured":"Yiwen Chen Zhihao Li Yikai Wang Hu Zhang Qin Li Chi Zhang and Guosheng Lin. 2025. Ultra3D: Efficient and High-Fidelity 3D Generation with Part Attention. arXiv:2507.17745 [cs.CV] https:\/\/arxiv.org\/abs\/2507.17745"},{"key":"e_1_2_1_7_1","unstructured":"Angela Dai Angel X. Chang Manolis Savva Maciej Halber Thomas Funkhouser and Matthias Nie\u00dfner. 2017. ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes. In arXiv."},{"key":"e_1_2_1_8_1","volume-title":"Samir Yitzhak Gadre, et al","author":"Deitke Matt","year":"2024","unstructured":"Matt Deitke, Ruoshi Liu, Matthew Wallingford, Huong Ngo, Oscar Michel, Aditya Kusupati, Alan Fan, Christian Laforte, Vikram Voleti, Samir Yitzhak Gadre, et al. 2024. Objaverse-xl: A universe of 10m+ 3d objects. Advances in Neural Information Processing Systems 36 (2024)."},{"key":"e_1_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01263"},{"key":"e_1_2_1_10_1","unstructured":"Ken Deng Yunhan Yang Jingxiang Sun Xihui Liu Yebin Liu Ding Liang and Yan-Pei Cao. 2025. GeoSAM2: Unleashing the Power of SAM2 for 3D Part Segmentation. In arXiv."},{"key":"e_1_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72698-9_2"},{"key":"e_1_2_1_12_1","doi-asserted-by":"crossref","unstructured":"Shaocong Dong Lihe Ding Xiao Chen Yaokun Li Yuxin Wang Yucheng Wang Qi Wang Jaehyeok Kim Chenjian Gao Zhanpeng Huang Zibin Wang Tianfan Xue and Dan Xu. 2025a. From One to More: Contextual Part Latents for 3D Generation. arXiv:2507.08772 [cs.CV] https:\/\/arxiv.org\/abs\/2507.08772","DOI":"10.1109\/ICCV51701.2025.00771"},{"key":"e_1_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Shaocong Dong Lihe Ding Xiao Chen Yaokun Li Yuxin Wang Yucheng Wang Qi Wang Jaehyeok Kim Chenjian Gao Zhanpeng Huang Zibin Wang Tianfan Xue and Dan Xu. 2025b. From One to More: Contextual Part Latents for 3D Generation. arXiv:2507.08772 [cs.CV] https:\/\/arxiv.org\/abs\/2507.08772","DOI":"10.1109\/ICCV51701.2025.00771"},{"key":"e_1_2_1_14_1","doi-asserted-by":"crossref","unstructured":"Daoyi Gao Yawar Siddiqui Lei Li and Angela Dai. 2025. MeshArt: Generating Articulated Meshes with Structure-Guided Transformers. arXiv:2412.11596 [cs.CV] https:\/\/arxiv.org\/abs\/2412.11596","DOI":"10.1109\/CVPR52734.2025.00066"},{"key":"e_1_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Marco Garosi Riccardo Tedoldi Davide Boscaini Massimiliano Mancini Nicu Sebe and Fabio Poiesi. 2025. 3D Part Segmentation via Geometric Aggregation of 2D Visual Features. In arXiv.","DOI":"10.1109\/WACV61041.2025.00322"},{"key":"e_1_2_1_16_1","unstructured":"Rana Hanocka Amir Hertz Noa Fish Raja Giryes Shachar Fleishman and Daniel Cohen-Or. 2019. MeshCNN: a network with an edge. In ACM."},{"key":"e_1_2_1_17_1","volume-title":"Meshtron: High-Fidelity, Artist-Like 3D Mesh Generation at Scale. arXiv:2412.09548 [cs.GR] https:\/\/arxiv.org\/abs\/2412.09548","author":"Hao Zekun","year":"2024","unstructured":"Zekun Hao, David W. Romero, Tsung-Yi Lin, and Ming-Yu Liu. 2024. Meshtron: High-Fidelity, Artist-Like 3D Mesh Generation at Scale. arXiv:2412.09548 [cs.GR] https:\/\/arxiv.org\/abs\/2412.09548"},{"key":"e_1_2_1_18_1","unstructured":"Zexin He Tengfei Wang Xin Huang Xingang Pan and Ziwei Liu. 2024. Neural LightRig: Unlocking Accurate Object Normal and Material Estimation with Multi-Light Diffusion. arXiv:2412.09593 [cs.CV] https:\/\/arxiv.org\/abs\/2412.09593"},{"key":"e_1_2_1_19_1","volume-title":"Denoising diffusion probabilistic models. Advances in neural information processing systems 33","author":"Ho Jonathan","year":"2020","unstructured":"Jonathan Ho, Ajay Jain, and Pieter Abbeel. 2020. Denoising diffusion probabilistic models. Advances in neural information processing systems 33 (2020), 6840\u20136851."},{"key":"e_1_2_1_20_1","volume-title":"Lrm: Large reconstruction model for single image to 3d. arXiv preprint arXiv:2311.04400","author":"Hong Yicong","year":"2023","unstructured":"Yicong Hong, Kai Zhang, Jiuxiang Gu, Sai Bi, Yang Zhou, Difan Liu, Feng Liu, Kalyan Sunkavalli, Trung Bui, and Hao Tan. 2023. Lrm: Large reconstruction model for single image to 3d. arXiv preprint arXiv:2311.04400 (2023)."},{"key":"e_1_2_1_21_1","volume-title":"European Conference on Computer Vision. Springer, 278\u2013295","author":"Huang Rui","year":"2024","unstructured":"Rui Huang, Songyou Peng, Ayca Takmaz, Federico Tombari, Marc Pollefeys, Shiji Song, Gao Huang, and Francis Engelmann. 2024b. Segment3d: Learning fine-grained class-agnostic 3d segmentation without manual labels. In European Conference on Computer Vision. Springer, 278\u2013295."},{"key":"e_1_2_1_22_1","volume-title":"Runmin Cong, Simon See, and Renjie Wan.","author":"Huang Xiufeng","year":"2025","unstructured":"Xiufeng Huang, Ka Chun Cheung, Runmin Cong, Simon See, and Renjie Wan. 2025. Stereo-GS: Multi-View Stereo Vision Model for Generalizable 3D Gaussian Splatting Reconstruction. arXiv:2507.14921 [cs.CV] https:\/\/arxiv.org\/abs\/2507.14921"},{"key":"e_1_2_1_23_1","volume-title":"Mv-adapter: Multi-view consistent image generation made easy. arXiv preprint arXiv:2412.03632","author":"Huang Zehuan","year":"2024","unstructured":"Zehuan Huang, Yuan-Chen Guo, Haoran Wang, Ran Yi, Lizhuang Ma, Yan-Pei Cao, and Lu Sheng. 2024a. Mv-adapter: Multi-view consistent image generation made easy. arXiv preprint arXiv:2412.03632 (2024)."},{"key":"e_1_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00934"},{"key":"e_1_2_1_25_1","volume-title":"Auto-encoding variational bayes. arXiv preprint arXiv:1312.6114","author":"Kingma Diederik P","year":"2013","unstructured":"Diederik P Kingma. 2013. Auto-encoding variational bayes. arXiv preprint arXiv:1312.6114 (2013)."},{"key":"e_1_2_1_26_1","unstructured":"Alexander Kirillov Eric Mintun Nikhila Ravi Hanzi Mao Chloe Rolland Laura Gustafson Tete Xiao Spencer Whitehead Alexander C. Berg Wan-Yen Lo Piotr Doll\u00e1r and Ross Girshick. 2023. Segment Anything. In arXiv."},{"key":"e_1_2_1_27_1","volume-title":"Voxhammer: Training-free precise and coherent 3d editing in native 3d space. arXiv preprint arXiv:2508.19247","author":"Li Lin","year":"2025","unstructured":"Lin Li, Zehuan Huang, Haoran Feng, Gengxiong Zhuang, Rui Chen, Chunchao Guo, and Lu Sheng. 2025a. Voxhammer: Training-free precise and coherent 3d editing in native 3d space. arXiv preprint arXiv:2508.19247 (2025)."},{"key":"e_1_2_1_28_1","doi-asserted-by":"crossref","unstructured":"Liunian Harold Li Pengchuan Zhang Haotian Zhang Jianwei Yang Chunyuan Li Yiwu Zhong Lijuan Wang Lu Yuan Lei Zhang Jenq-Neng Hwang Kai-Wei Chang and Jianfeng Gao. 2022. Grounded Language-Image Pre-training. In arXiv.","DOI":"10.1109\/CVPR52688.2022.01069"},{"key":"e_1_2_1_29_1","volume-title":"CraftsMan: High-fidelity Mesh Generation with 3D Native Generation and Interactive Geometry Refiner. arXiv preprint arXiv:2405.14979","author":"Li Weiyu","year":"2024","unstructured":"Weiyu Li, Jiarui Liu, Rui Chen, Yixun Liang, Xuelin Chen, Ping Tan, and Xiaoxiao Long. 2024. CraftsMan: High-fidelity Mesh Generation with 3D Native Generation and Interactive Geometry Refiner. arXiv preprint arXiv:2405.14979 (2024)."},{"key":"e_1_2_1_30_1","unstructured":"Weiyu Li Jiarui Liu Hongyu Yan Rui Chen Yixun Liang Xuelin Chen Ping Tan and Xiaoxiao Long. 2025b. CraftsMan3D: High-fidelity Mesh Generation with 3D Native Generation and Interactive Geometry Refiner. arXiv:2405.14979 [cs.GR] https:\/\/arxiv.org\/abs\/2405.14979"},{"key":"e_1_2_1_31_1","unstructured":"Weiyu Li Xuanyang Zhang Zheng Sun Di Qi Hao Li Wei Cheng Weiwei Cai Shihao Wu Jiarui Liu Zihao Wang Xiao Chen Feipeng Tian Jianxiong Pan Zeming Li Gang Yu Xiangyu Zhang Daxin Jiang and Ping Tan. 2025c. Step1X-3D: Towards High-Fidelity and Controllable Generation of Textured 3D Assets. arXiv:2505.07747 [cs.CV] https:\/\/arxiv.org\/abs\/2505.07747"},{"key":"e_1_2_1_32_1","unstructured":"Yangguang Li Zi-Xin Zou Zexiang Liu Dehu Wang Yuan Liang Zhipeng Yu Xingchao Liu Yuan-Chen Guo Ding Liang Wanli Ouyang et al. 2025e. TripoSG: High-Fidelity 3D Shape Synthesis using Large-Scale Rectified Flow Models. arXiv preprint arXiv:2502.06608 (2025)."},{"key":"e_1_2_1_33_1","unstructured":"Yangguang Li Zi-Xin Zou Zexiang Liu Dehu Wang Yuan Liang Zhipeng Yu Xingchao Liu Yuan-Chen Guo Ding Liang Wanli Ouyang and Yan-Pei Cao. 2025d. TripoSG: High-Fidelity 3D Shape Synthesis using Large-Scale Rectified Flow Models. arXiv:2502.06608 [cs.CV] https:\/\/arxiv.org\/abs\/2502.06608"},{"key":"e_1_2_1_34_1","doi-asserted-by":"crossref","unstructured":"Kevin Lin Lijuan Wang and Zicheng Liu. 2021. End-to-End Human Pose and Mesh Reconstruction with Transformers. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00199"},{"key":"e_1_2_1_35_1","unstructured":"Yuchen Lin Chenguo Lin Panwang Pan Honglei Yan Yiqiang Feng Yadong Mu and Katerina Fragkiadaki. 2025. PartCrafter: Structured 3D Mesh Generation via Compositional Latent Diffusion Transformers. arXiv:2506.05573 [cs.CV] https:\/\/arxiv.org\/abs\/2506.05573"},{"key":"e_1_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1145\/3641519.3657482"},{"key":"e_1_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00960"},{"key":"e_1_2_1_38_1","volume-title":"Donglai Xiang, Hao Su, Sanja Fidler, Nicholas Sharp, and Jun Gao.","author":"Liu Minghua","year":"2025","unstructured":"Minghua Liu, Mikaela Angelina Uy, Donglai Xiang, Hao Su, Sanja Fidler, Nicholas Sharp, and Jun Gao. 2025. PartField: Learning 3D Feature Fields for Part Segmentation and Beyond. In ICCV."},{"key":"e_1_2_1_39_1","volume-title":"One-2-3-45: Any single image to 3d mesh in 45 seconds without per-shape optimization. Advances in Neural Information Processing Systems 36","author":"Liu Minghua","year":"2024","unstructured":"Minghua Liu, Chao Xu, Haian Jin, Linghao Chen, Mukund Varma T, Zexiang Xu, and Hao Su. 2024c. One-2-3-45: Any single image to 3d mesh in 45 seconds without per-shape optimization. Advances in Neural Information Processing Systems 36 (2024)."},{"key":"e_1_2_1_40_1","volume-title":"Syncdreamer: Generating multiview-consistent images from a single-view image. arXiv preprint arXiv:2309.03453","author":"Liu Yuan","year":"2023","unstructured":"Yuan Liu, Cheng Lin, Zijiao Zeng, Xiaoxiao Long, Lingjie Liu, Taku Komura, and Wenping Wang. 2023. Syncdreamer: Generating multiview-consistent images from a single-view image. arXiv preprint arXiv:2309.03453 (2023)."},{"key":"e_1_2_1_41_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00951"},{"key":"e_1_2_1_42_1","unstructured":"Ilya Loshchilov and Frank Hutter. 2019. Decoupled Weight Decay Regularization. arXiv:1711.05101 [cs.LG] https:\/\/arxiv.org\/abs\/1711.05101"},{"key":"e_1_2_1_43_1","unstructured":"Changfeng Ma Yang Li Xinhao Yan Jiachen Xu Yunhan Yang Chunshi Wang Zibo Zhao Yanwen Guo Zhuo Chen and Chunchao Guo. 2025a. P3-sam: Native 3d part segmentation. In arXiv."},{"key":"e_1_2_1_44_1","unstructured":"Ziqi Ma Yisong Yue and Georgia Gkioxari. 2025b. Find Any Part in 3D. In arXiv."},{"key":"e_1_2_1_45_1","volume-title":"LT3SD: Latent Trees for 3D Scene Diffusion. arXiv preprint arXiv:2409.08215","author":"Meng Quan","year":"2024","unstructured":"Quan Meng, Lei Li, Matthias Nie\u00dfner, and Angela Dai. 2024. LT3SD: Latent Trees for 3D Scene Diffusion. arXiv preprint arXiv:2409.08215 (2024)."},{"key":"e_1_2_1_46_1","unstructured":"Kaichun Mo Shilin Zhu Angel X. Chang Li Yi Subarna Tripathi Leonidas J. Guibas and Hao Su. 2019. PartNet: A Large-Scale Benchmark for Fine-Grained and Hierarchical Part-Level 3D Object Understanding. In CVPR."},{"key":"e_1_2_1_47_1","unstructured":"Maxime Oquab Timoth\u00e9e Darcet Theo Moutakanni Huy V. Vo Marc Szafraniec Vasil Khalidov Pierre Fernandez Daniel Haziza Francisco Massa Alaaeldin El-Nouby Russell Howes Po-Yao Huang Hu Xu Vasu Sharma Shang-Wen Li Wojciech Galuba Mike Rabbat Mido Assran Nicolas Ballas Gabriel Synnaeve Ishan Misra Herve Jegou Julien Mairal Patrick Labatut Armand Joulin and Piotr Bojanowski. 2023. DINOv2: Learning Robust Visual Features without Supervision. In arXiv."},{"key":"e_1_2_1_48_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"e_1_2_1_49_1","doi-asserted-by":"crossref","unstructured":"Charles R Qi Hao Su Kaichun Mo and Leonidas J Guibas. 2017. PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation. In arXiv preprint arXiv:1612.00593.","DOI":"10.1109\/CVPR.2017.16"},{"key":"e_1_2_1_50_1","unstructured":"Yansong Qu Shaohui Dai Xinyang Li Yuze Wang You Shen Liujuan Cao and Rongrong Ji. 2025. DeOcc-1-to-3: 3D De-Occlusion from a Single Image via Self-Supervised Multi-View Diffusion. arXiv:2506.21544 [cs.CV] https:\/\/arxiv.org\/abs\/2506.21544"},{"key":"e_1_2_1_51_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. In arXiv."},{"key":"e_1_2_1_52_1","volume-title":"Nicolas Carion, Chao-Yuan Wu, Ross Girshick, Piotr Doll\u00e1r, and Christoph Feichtenhofer.","author":"Ravi Nikhila","year":"2024","unstructured":"Nikhila Ravi, Valentin Gabeur, Yuan-Ting Hu, Ronghang Hu, Chaitanya Ryali, Tengyu Ma, Haitham Khedr, Roman R\u00e4dle, Chloe Rolland, Laura Gustafson, Eric Mintun, Junting Pan, Kalyan Vasudev Alwala, Nicolas Carion, Chao-Yuan Wu, Ross Girshick, Piotr Doll\u00e1r, and Christoph Feichtenhofer. 2024. SAM 2: Segment Anything in Images and Videos. In arXiv."},{"key":"e_1_2_1_53_1","volume-title":"Peter Kontschieder, Angela Dai, and Matthias Nie\u00dfner.","author":"Roessle Barbara","year":"2024","unstructured":"Barbara Roessle, Norman M\u00fcller, Lorenzo Porzi, Samuel Rota Bul\u00f8, Peter Kontschieder, Angela Dai, and Matthias Nie\u00dfner. 2024. L3DG: Latent 3D Gaussian Diffusion. arXiv preprint arXiv:2410.13530 (2024)."},{"key":"e_1_2_1_54_1","volume-title":"Denoising diffusion implicit models. arXiv preprint arXiv:2010.02502","author":"Song Jiaming","year":"2020","unstructured":"Jiaming Song, Chenlin Meng, and Stefano Ermon. 2020. Denoising diffusion implicit models. arXiv preprint arXiv:2010.02502 (2020)."},{"key":"e_1_2_1_55_1","unstructured":"George Tang William Zhao Logan Ford David Benhaim and Paul Zhang. 2025c. Segment Any Mesh. In arXiv."},{"key":"e_1_2_1_56_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73235-5_1"},{"key":"e_1_2_1_57_1","volume-title":"Efficient Part-level 3D Object Generation via Dual","author":"Tang Jiaxiang","unstructured":"Jiaxiang Tang, Ruijie Lu, Zhaoshuo Li, Zekun Hao, Xuan Li, Fangyin Wei, Shuran Song, Gang Zeng, Ming-Yu Liu, and Tsung-Yi Lin. 2025b. Efficient Part-level 3D Object Generation via Dual Volume Packing. arXiv:2506.09980 [cs.CV] https:\/\/arxiv.org\/abs\/2506.09980"},{"key":"e_1_2_1_58_1","doi-asserted-by":"crossref","unstructured":"Ardian Umam Cheng-Kun Yang Min-Hung Chen Jen-Hui Chuang and Yen-Yu Lin. 2024. PartDistill: 3D Shape Part Segmentation by Vision-Language Model Distillation. In arXiv.","DOI":"10.1109\/CVPR52733.2024.00333"},{"key":"e_1_2_1_59_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73232-4_25"},{"key":"e_1_2_1_60_1","unstructured":"Penghao Wang Yiyang He Xin Lv Yukai Zhou Lan Xu Jingyi Yu and Jiayuan Gu. 2025. PartNeXt: A Next-Generation Dataset for Fine-Grained and Hierarchical 3D Part Understanding. arXiv:2510.20155 [cs.CV] https:\/\/arxiv.org\/abs\/2510.20155"},{"key":"e_1_2_1_61_1","unstructured":"Zhengyi Wang Jonathan Lorraine Yikai Wang Hang Su Jun Zhu Sanja Fidler and Xiaohui Zeng. 2024a. LLaMA-Mesh: Unifying 3D Mesh Generation with Language Models. arXiv:2411.09595 [cs.LG] https:\/\/arxiv.org\/abs\/2411.09595"},{"key":"e_1_2_1_62_1","volume-title":"Crm: Single image to 3d textured mesh with convolutional reconstruction model. arXiv preprint arXiv:2403.05034","author":"Wang Zhengyi","year":"2024","unstructured":"Zhengyi Wang, Yikai Wang, Yifei Chen, Chendong Xiang, Shuo Chen, Dajiang Yu, Chongxuan Li, Hang Su, and Jun Zhu. 2024b. Crm: Single image to 3d textured mesh with convolutional reconstruction model. arXiv preprint arXiv:2403.05034 (2024)."},{"key":"e_1_2_1_63_1","unstructured":"Si-Tong Wei Rui-Huan Wang Chuan-Zhi Zhou Baoquan Chen and Peng-Shuai Wang. 2025. OctGPT: Octree-based Multiscale Autoregressive Models for 3D Shape Generation. arXiv:2504.09975 [cs.GR] https:\/\/arxiv.org\/abs\/2504.09975"},{"key":"e_1_2_1_64_1","volume-title":"Ouroboros3D: Image-to-3D Generation via 3D-aware Recursive Diffusion. arXiv preprint arXiv:2406.03184","author":"Wen Hao","year":"2024","unstructured":"Hao Wen, Zehuan Huang, Yaohui Wang, Xinyuan Chen, Yu Qiao, and Lu Sheng. 2024. Ouroboros3D: Image-to-3D Generation via 3D-aware Recursive Diffusion. arXiv preprint arXiv:2406.03184 (2024)."},{"key":"e_1_2_1_65_1","volume-title":"Unique3D: High-Quality and Efficient 3D Mesh Generation from a Single Image. arXiv preprint arXiv:2405.20343","author":"Wu Kailu","year":"2024","unstructured":"Kailu Wu, Fangfu Liu, Zhihan Cai, Runjie Yan, Hanyang Wang, Yating Hu, Yueqi Duan, and Kaisheng Ma. 2024d. Unique3D: High-Quality and Efficient 3D Mesh Generation from a Single Image. arXiv preprint arXiv:2405.20343 (2024)."},{"key":"e_1_2_1_66_1","volume-title":"DIPO: Dual-State Images Controlled Articulated Object Generation Powered by Diverse Data. arXiv:2505.20460 [cs.CV] https:\/\/arxiv.org\/abs\/2505.20460","author":"Wu Ruiqi","year":"2025","unstructured":"Ruiqi Wu, Xinjie Wang, Liu Liu, Chunle Guo, Jiaxiong Qiu, Chongyi Li, Lichao Huang, Zhizhong Su, and Ming-Ming Cheng. 2025b. DIPO: Dual-State Images Controlled Articulated Object Generation Powered by Diverse Data. arXiv:2505.20460 [cs.CV] https:\/\/arxiv.org\/abs\/2505.20460"},{"key":"e_1_2_1_67_1","volume-title":"Direct3D: Scalable Image-to-3D Generation via 3D Latent Diffusion Transformer. arXiv preprint arXiv:2405.14832","author":"Wu Shuang","year":"2024","unstructured":"Shuang Wu, Youtian Lin, Feihu Zhang, Yifei Zeng, Jingxi Xu, Philip Torr, Xun Cao, and Yao Yao. 2024c. Direct3D: Scalable Image-to-3D Generation via 3D Latent Diffusion Transformer. arXiv preprint arXiv:2405.14832 (2024)."},{"key":"e_1_2_1_68_1","unstructured":"Shuang Wu Youtian Lin Feihu Zhang Yifei Zeng Yikang Yang Yajie Bao Jiachen Qian Siyu Zhu Xun Cao Philip Torr and Yao Yao. 2025a. Direct3D-S2: Gigascale 3D Generation Made Easy with Spatial Sparse Attention. arXiv:2505.17412 [cs.CV] https:\/\/arxiv.org\/abs\/2505.17412"},{"key":"e_1_2_1_69_1","unstructured":"Xiaoyang Wu Li Jiang Peng-Shuai Wang Zhijian Liu Xihui Liu Yu Qiao Wanli Ouyang Tong He and Hengshuang Zhao. 2024a. Point Transformer V3: Simpler Faster Stronger. In CVPR."},{"key":"e_1_2_1_70_1","unstructured":"Xiaoyang Wu Yixing Lao Li Jiang Xihui Liu and Hengshuang Zhao. 2022. Point transformer V2: Grouped Vector Attention and Partition-based Pooling. In NeurIPS."},{"key":"e_1_2_1_71_1","unstructured":"Xiaoyang Wu Zhuotao Tian Xin Wen Bohao Peng Xihui Liu Kaicheng Yu and Hengshuang Zhao. 2024e. Towards Large-scale 3D Representation Learning with Multi-dataset Point Prompt Training. In CVPR."},{"key":"e_1_2_1_72_1","doi-asserted-by":"publisher","DOI":"10.1145\/3658188"},{"key":"e_1_2_1_73_1","volume-title":"Nicholas Jing Yuan, et al","author":"Xiang Jianfeng","year":"2025","unstructured":"Jianfeng Xiang, Xiaoxue Chen, Sicheng Xu, Ruicheng Wang, Zelong Lv, Yu Deng, Hongyuan Zhu, Yue Dong, Hao Zhao, Nicholas Jing Yuan, et al. 2025a. Native and Compact Structured Latents for 3D Generation. In arXiv."},{"key":"e_1_2_1_74_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02000"},{"key":"e_1_2_1_75_1","volume-title":"Instantmesh: Efficient 3d mesh generation from a single image with sparse-view large reconstruction models. arXiv preprint arXiv:2404.07191","author":"Xu Jiale","year":"2024","unstructured":"Jiale Xu, Weihao Cheng, Yiming Gao, Xintao Wang, Shenghua Gao, and Ying Shan. 2024. Instantmesh: Efficient 3d mesh generation from a single image with sparse-view large reconstruction models. arXiv preprint arXiv:2404.07191 (2024)."},{"key":"e_1_2_1_76_1","unstructured":"Mutian Xu Xingyilang Yin Lingteng Qiu Yang Liu Xin Tong and Xiaoguang Han. 2025. SAMPro3D: Locating SAM Prompts in 3D for Zero-Shot Instance Segmentation. In arXiv."},{"key":"e_1_2_1_77_1","unstructured":"Yuheng Xue Nenglun Chen Jun Liu and Wenyun Sun. 2025. ZeroPS: High-quality Cross-modal Knowledge Transfer for Zero-Shot 3D Part Segmentation. In arXiv."},{"key":"e_1_2_1_78_1","unstructured":"Yunhan Yang Yukun Huang Yuan-Chen Guo Liangjun Lu Xiaoyang Wu Edmund Y. Lam Yan-Pei Cao and Xihui Liu. 2024a. SAMPart3D: Segment Any Part in 3D Objects. In arXiv."},{"key":"e_1_2_1_79_1","unstructured":"Yunhan Yang Yukun Huang Yuan-Chen Guo Liangjun Lu Xiaoyang Wu Edmund Y. Lam Yan-Pei Cao and Xihui Liu. 2024b. SAMPart3D: Segment Any Part in 3D Objects. arXiv:2411.07184 [cs.CV] https:\/\/arxiv.org\/abs\/2411.07184"},{"key":"e_1_2_1_80_1","unstructured":"Yunhan Yang Xiaoyang Wu Tong He Hengshuang Zhao and Xihui Liu. 2023. SAM3D: Segment Anything in 3D Scenes. In arXiv."},{"key":"e_1_2_1_81_1","unstructured":"Junliang Ye Zhengyi Wang Ruowen Zhao Shenghao Xie and Jun Zhu. 2025. ShapeLLM-Omni: A Native Multimodal LLM for 3D Generation and Understanding. arXiv:2506.01853 [cs.CV] https:\/\/arxiv.org\/abs\/2506.01853"},{"key":"e_1_2_1_82_1","doi-asserted-by":"publisher","DOI":"10.1145\/3658146"},{"key":"e_1_2_1_83_1","doi-asserted-by":"crossref","unstructured":"Ruowen Zhao Junliang Ye Zhengyi Wang Guangce Liu Yiwen Chen Yikai Wang and Jun Zhu. 2025b. DeepMesh: Auto-Regressive Artist-mesh Creation with Reinforcement Learning. arXiv:2503.15265 [cs.CV] https:\/\/arxiv.org\/abs\/2503.15265","DOI":"10.1109\/ICCV51701.2025.00988"},{"key":"e_1_2_1_84_1","volume-title":"Assembler: Scalable 3D Part Assembly via Anchor Point Diffusion. arXiv:2506.17074 [cs.CV] https:\/\/arxiv.org\/abs\/2506.17074","author":"Zhao Wang","year":"2025","unstructured":"Wang Zhao, Yan-Pei Cao, Jiale Xu, Yuejiang Dong, and Ying Shan. 2025a. Assembler: Scalable 3D Part Assembly via Anchor Point Diffusion. arXiv:2506.17074 [cs.CV] https:\/\/arxiv.org\/abs\/2506.17074"},{"key":"e_1_2_1_85_1","volume-title":"Michelangelo: Conditional 3d shape generation based on shape-image-text aligned latent representation. Advances in Neural Information Processing Systems 36","author":"Zhao Zibo","year":"2024","unstructured":"Zibo Zhao, Wen Liu, Xin Chen, Xianfang Zeng, Rui Wang, Pei Cheng, Bin Fu, Tao Chen, Gang Yu, and Shenghua Gao. 2024. Michelangelo: Conditional 3d shape generation based on shape-image-text aligned latent representation. Advances in Neural Information Processing Systems 36 (2024)."},{"key":"e_1_2_1_86_1","volume-title":"The Thirteenth International Conference on Learning Representations.","author":"Zhou Yuchen","year":"2025","unstructured":"Yuchen Zhou, Jiayuan Gu, Tung Yen Chiang, Fanbo Xiang, and Hao Su. 2025. Point-SAM: Promptable 3D Segmentation Model for Point Clouds. In The Thirteenth International Conference on Learning Representations."},{"key":"e_1_2_1_87_1","unstructured":"Yuchen Zhou Jiayuan Gu Xuanlin Li Minghua Liu Yunhao Fang and Hao Su. 2023. PartSLIP++: Enhancing Low-Shot 3D Part Segmentation via Multi-View Instance Segmentation and Maximum Likelihood Estimation. In arXiv."},{"key":"e_1_2_1_88_1","unstructured":"Zhe Zhu Le Wan Rui Xu Yiheng Zhang Honghua Chen Zhiyang Dou Cheng Lin Yuan Liu and Mingqiang Wei. 2025. PartSAM: A Scalable Promptable Part Segmentation Model Trained on Native 3D Data. In arXiv."}],"container-title":["ACM Transactions on Graphics"],"original-title":[],"language":"en","deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T07:31:53Z","timestamp":1783063913000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3811399"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,3]]},"references-count":88,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2026,7,3]]}},"alternative-id":["10.1145\/3811399"],"URL":"https:\/\/doi.org\/10.1145\/3811399","relation":{},"ISSN":["0730-0301","1557-7368"],"issn-type":[{"value":"0730-0301","type":"print"},{"value":"1557-7368","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,7,3]]},"assertion":[{"value":"2026-01-22","order":0,"name":"received","label":"Received","group":{"name":"publication_history","label":"Publication History"}},{"value":"2026-03-27","order":2,"name":"accepted","label":"Accepted","group":{"name":"publication_history","label":"Publication History"}},{"value":"2026-07-03","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}