{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T04:43:18Z","timestamp":1781584998775,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":57,"publisher":"ACM","funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62476011"],"award-info":[{"award-number":["62476011"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3754740","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T07:26:55Z","timestamp":1761377215000},"page":"925-934","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":3,"title":["EmbodiedOcc++: Boosting Embodied 3D Occupancy Prediction with Plane Regularization and Uncertainty Sampler"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-0208-6284","authenticated-orcid":false,"given":"Hao","family":"Wang","sequence":"first","affiliation":[{"name":"State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4230-1162","authenticated-orcid":false,"given":"Xiaobao","family":"Wei","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-0659-851X","authenticated-orcid":false,"given":"Xiaoan","family":"Zhang","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9552-2247","authenticated-orcid":false,"given":"Jianing","family":"Li","sequence":"additional","affiliation":[{"name":"School of Electronic Science and Engineering, Nanjing University, Nanjing, Jiangsu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-6937-0877","authenticated-orcid":false,"given":"Chengyu","family":"Bai","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-2587-3489","authenticated-orcid":false,"given":"Ying","family":"Li","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6819-6490","authenticated-orcid":false,"given":"Ming","family":"Lu","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7188-3734","authenticated-orcid":false,"given":"Wenzhao","family":"Zheng","sequence":"additional","affiliation":[{"name":"Berkeley Artificial Intelligence Research Lab, Department of EECS, University of California, Berkeley, Berkeley, California, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4047-3526","authenticated-orcid":false,"given":"Shanghang","family":"Zhang","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01289"},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00396"},{"key":"e_1_3_2_1_3_1","volume-title":"Pgsr: Planar-based gaussian splatting for efficient and high-fidelity surface reconstruction","author":"Chen Danpeng","year":"2024","unstructured":"Danpeng Chen, Hai Li, Weicai Ye, Yifan Wang, Weijian Xie, Shangjin Zhai, Nan Wang, Haomin Liu, Hujun Bao, and Guofeng Zhang. 2024. Pgsr: Planar-based gaussian splatting for efficient and high-fidelity surface reconstruction. IEEE Transactions on Visualization and Computer Graphics (2024)."},{"key":"e_1_3_2_1_4_1","volume-title":"International Conference on Machine Learning. PMLR, PMLR, 1050-1059","author":"Gal Yarin","year":"2016","unstructured":"Yarin Gal and Zoubin Ghahramani. 2016. Dropout as a bayesian approximation: Representing model uncertainty in deep learning. In International Conference on Machine Learning. PMLR, PMLR, 1050-1059."},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00019"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00512"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10610625"},{"key":"e_1_3_2_1_8_1","volume-title":"S3Gaussian: Self-Supervised Street Gaussians for Autonomous Driving. arXiv preprint arXiv:2405.20323","author":"Huang Nan","year":"2024","unstructured":"Nan Huang, Xiaobao Wei, Wenzhao Zheng, Pengju An, Ming Lu, Wei Zhan, Masayoshi Tomizuka, Kurt Keutzer, and Shanghang Zhang. 2024b. S3Gaussian: Self-Supervised Street Gaussians for Autonomous Driving. arXiv preprint arXiv:2405.20323 (2024)."},{"key":"e_1_3_2_1_9_1","volume-title":"Probabilistic Gaussian Superposition for Efficient 3D Occupancy Prediction. arXiv preprint arXiv:2412.04384","author":"Huang Yuanhui","year":"2024","unstructured":"Yuanhui Huang, Amonnut Thammatadatrakoon, Wenzhao Zheng, Yunpeng Zhang, Dalong Du, and Jiwen Lu. 2024a. Probabilistic Gaussian Superposition for Efficient 3D Occupancy Prediction. arXiv preprint arXiv:2412.04384 (2024)."},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01885"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00890"},{"key":"e_1_3_2_1_12_1","first-page":"376","volume-title":"European Conference on Computer Vision. Springer","author":"Huang Yuanhui","year":"2024","unstructured":"Yuanhui Huang, Wenzhao Zheng, Yunpeng Zhang, Jie Zhou, and Jiwen Lu. 2024d. Gaussianformer: Scene as gaussians for vision-based 3d semantic occupancy prediction. In European Conference on Computer Vision. Springer, Springer, Berlin, Germany, 376-393."},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2022.3144491"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02018"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1145\/3592433"},{"key":"e_1_3_2_1_16_1","first-page":"11","article-title":"Multi-modal data-efficient 3d scene understanding for autonomous driving","volume":"43","author":"Kong Lingdong","year":"2025","unstructured":"Lingdong Kong, Xiang Xu, Jiawei Ren, Wenwei Zhang, Liang Pan, Kai Chen, Wei Tsang Ooi, and Ziwei Liu. 2025. Multi-modal data-efficient 3d scene understanding for autonomous driving. IEEE Transactions on Pattern Analysis and Machine Intelligence, Vol. 43, 11 (2025), 11.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1145\/3550454.3555429"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02078"},{"key":"e_1_3_2_1_19_1","volume-title":"SliceOcc: Indoor 3D Semantic Occupancy Prediction with Vertical Slice Representation. arXiv preprint arXiv:2501.16684","author":"Li Jianing","year":"2025","unstructured":"Jianing Li, Ming Lu, Hao Wang, Chenyang Gu, Wenzhao Zheng, Li Du, and Shanghang Zhang. 2025. SliceOcc: Indoor 3D Semantic Occupancy Prediction with Vertical Slice Representation. arXiv preprint arXiv:2501.16684 (2025)."},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00817"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00494"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00459"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503250"},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00548"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA57147.2024.10611537"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58580-8_31"},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01919"},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19827-4_1"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1109\/3DV53792.2021.00042"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01534"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00972"},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01424"},{"key":"e_1_3_2_1_33_1","volume-title":"Dn-splatter: Depth and normal priors for gaussian splatting and meshing. arXiv preprint arXiv:2403.17822","author":"Turkulainen Matias","year":"2024","unstructured":"Matias Turkulainen, Xuqian Ren, Iaroslav Melekhov, Otto Seiskari, Esa Rahtu, and Juho Kannala. 2024. Dn-splatter: Depth and normal priors for gaussian splatting and meshing. arXiv preprint arXiv:2403.17822 (2024)."},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01868"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01636"},{"key":"e_1_3_2_1_36_1","volume-title":"PLGS: Robust Panoptic Lifting with 3D Gaussian Splatting. arXiv preprint arXiv:2410.17505","author":"Wang Yu","year":"2024","unstructured":"Yu Wang, Xiaobao Wei, Ming Lu, and Guoliang Kang. 2024b. PLGS: Robust Panoptic Lifting with 3D Gaussian Splatting. arXiv preprint arXiv:2410.17505 (2024)."},{"key":"e_1_3_2_1_37_1","first-page":"90","volume-title":"European Conference on Computer Vision. Springer","author":"Wei Xiaobao","year":"2024","unstructured":"Xiaobao Wei, Jiajun Cao, Yizhu Jin, Ming Lu, Guangyu Wang, and Shanghang Zhang. 2024a. I-medsam: Implicit medical image segmentation with segment anything. In European Conference on Computer Vision. Springer, Springer, Munich, Germany, 90-107."},{"key":"e_1_3_2_1_38_1","volume-title":"GazeGaussian: High-Fidelity Gaze Redirection with 3D Gaussian Splatting. arXiv preprint arXiv:2411.12981","author":"Wei Xiaobao","year":"2024","unstructured":"Xiaobao Wei, Peng Chen, Guangyu Li, Ming Lu, Hui Chen, and Feng Tian. 2024b. GazeGaussian: High-Fidelity Gaze Redirection with 3D Gaussian Splatting. arXiv preprint arXiv:2411.12981 (2024)."},{"key":"e_1_3_2_1_39_1","volume-title":"GraphAvatar: Compact Head Avatars with GNN-Generated 3D Gaussians. arXiv preprint arXiv:2412.13983","author":"Wei Xiaobao","year":"2024","unstructured":"Xiaobao Wei, Peng Chen, Ming Lu, Hui Chen, and Feng Tian. 2024c. GraphAvatar: Compact Head Avatars with GNN-Generated 3D Gaussians. arXiv preprint arXiv:2412.13983 (2024)."},{"key":"e_1_3_2_1_40_1","volume-title":"EMD: Explicit Motion Modeling for High-Quality Street Gaussian Splatting. arXiv preprint arXiv:2411.15582","author":"Wei Xiaobao","year":"2024","unstructured":"Xiaobao Wei, Qingpo Wuwu, Zhongyu Zhao, Zhuangzhe Wu, Nan Huang, Ming Lu, Ningning Ma, and Shanghang Zhang. 2024d. EMD: Explicit Motion Modeling for High-Quality Street Gaussian Splatting. arXiv preprint arXiv:2411.15582 (2024)."},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01924"},{"key":"e_1_3_2_1_42_1","volume-title":"OmniIndoor3D: Comprehensive Indoor 3D Reconstruction. arXiv preprint arXiv:2505.20610","author":"Wei Xiaobao","year":"2025","unstructured":"Xiaobao Wei, Xiaoan Zhang, Hao Wang, Qingpo Wuwu, Ming Lu, Wenzhao Zheng, and Shanghang Zhang. 2025. OmniIndoor3D: Comprehensive Indoor 3D Reconstruction. arXiv preprint arXiv:2505.20610 (2025)."},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01986"},{"key":"e_1_3_2_1_44_1","volume-title":"Embodiedocc: Embodied 3d occupancy prediction for vision-based online scene understanding. arXiv preprint arXiv:2412.04380","author":"Wu Yuqi","year":"2024","unstructured":"Yuqi Wu, Wenzhao Zheng, Sicheng Zuo, Yuanhui Huang, Jie Zhou, and Jiwen Lu. 2024. Embodiedocc: Embodied 3d occupancy prediction for vision-based online scene understanding. arXiv preprint arXiv:2412.04380 (2024)."},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01853"},{"key":"e_1_3_2_1_46_1","first-page":"21875","article-title":"Depth anything v2","volume":"37","author":"Yang Lihe","year":"2024","unstructured":"Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiaogang Xu, Jiashi Feng, and Hengshuang Zhao. 2024. Depth anything v2. Advances in Neural Information Processing Systems, Vol. 37 (2024), 21875-21911.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00867"},{"key":"e_1_3_2_1_48_1","first-page":"4805","article-title":"Volume rendering of neural implicit surfaces","volume":"34","author":"Yariv Lior","year":"2021","unstructured":"Lior Yariv, Jiatao Gu, Yoni Kasten, and Yaron Lipman. 2021. Volume rendering of neural implicit surfaces. Advances in Neural Information Processing Systems, Vol. 34 (2021), 4805-4815.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_49_1","first-page":"38","volume-title":"European Conference on Computer Vision. Springer","author":"Yu Hongxiao","year":"2024","unstructured":"Hongxiao Yu, Yuqi Wang, Yuntao Chen, and Zhaoxiang Zhang. 2024b. Monocular occupancy prediction for scalable indoor scenes. In European Conference on Computer Vision. Springer, Springer, Berlin, Germany, 38-54."},{"key":"e_1_3_2_1_50_1","volume-title":"Gsdf: 3dgs meets sdf for improved rendering and reconstruction. arXiv preprint arXiv:2403.16964","author":"Yu Mulin","year":"2024","unstructured":"Mulin Yu, Tao Lu, Linning Xu, Lihan Jiang, Yuanbo Xiangli, and Bo Dai. 2024a. Gsdf: 3dgs meets sdf for improved rendering and reconstruction. arXiv preprint arXiv:2403.16964, Vol. 1, 1 (2024), 1-12."},{"key":"e_1_3_2_1_51_1","first-page":"25018","article-title":"Monosdf: Exploring monocular geometric cues for neural implicit surface reconstruction","volume":"35","author":"Yu Zehao","year":"2022","unstructured":"Zehao Yu, Songyou Peng, Michael Niemeyer, Torsten Sattler, and Andreas Geiger. 2022. Monosdf: Exploring monocular geometric cues for neural implicit surface reconstruction. Advances in Neural Information Processing Systems, Vol. 35 (2022), 25018-25032.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_1_52_1","volume-title":"Rade-gs: Rasterizing depth in gaussian splatting. arXiv preprint arXiv:2406.01467","author":"Zhang Baowen","year":"2024","unstructured":"Baowen Zhang, Chuan Fang, Rakesh Shrestha, Yixun Liang, Xiaoxiao Long, and Ping Tan. 2024. Rade-gs: Rasterizing depth in gaussian splatting. arXiv preprint arXiv:2406.01467 (2024)."},{"key":"e_1_3_2_1_53_1","first-page":"100392","article-title":"Outdoor scene understanding of mobile robot via multi-sensor information fusion","volume":"30","author":"Song Jun","year":"2022","unstructured":"Fu-sheng Zhang, Dong-yuan Ge, Jun Song, and Wen-jiang Xiang. 2022. Outdoor scene understanding of mobile robot via multi-sensor information fusion. Journal of Industrial Information Integration, Vol. 30 (2022), 100392.","journal-title":"Journal of Industrial Information Integration"},{"key":"e_1_3_2_1_54_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00865"},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2024.3416798"},{"key":"e_1_3_2_1_56_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01245"},{"key":"e_1_3_2_1_57_1","volume-title":"Pointocc: Cylindrical tri-perspective view for point-based 3d semantic occupancy prediction. arXiv preprint arXiv:2308.16896","author":"Zuo Sicheng","year":"2023","unstructured":"Sicheng Zuo, Wenzhao Zheng, Yuanhui Huang, Jie Zhou, and Jiwen Lu. 2023. Pointocc: Cylindrical tri-perspective view for point-based 3d semantic occupancy prediction. arXiv preprint arXiv:2308.16896, Vol. 2, 1 (2023), 101-112."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","acronym":"MM '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3754740","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T05:03:15Z","timestamp":1765342995000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3754740"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":57,"alternative-id":["10.1145\/3746027.3754740","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3754740","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}