{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,16]],"date-time":"2026-05-16T00:05:42Z","timestamp":1778889942465,"version":"3.51.4"},"publisher-location":"Singapore","reference-count":61,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819609710","type":"print"},{"value":"9789819609727","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,12,10]],"date-time":"2024-12-10T00:00:00Z","timestamp":1733788800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,10]],"date-time":"2024-12-10T00:00:00Z","timestamp":1733788800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-96-0972-7_14","type":"book-chapter","created":{"date-parts":[[2024,12,9]],"date-time":"2024-12-09T08:12:37Z","timestamp":1733731957000},"page":"232-249","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":12,"title":["OccFusion: Depth Estimation Free Multi-sensor Fusion for\u00a03D Occupancy Prediction"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-1759-5184","authenticated-orcid":false,"given":"Ji","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-8624-8545","authenticated-orcid":false,"given":"Yiran","family":"Ding","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-2353-7847","authenticated-orcid":false,"given":"Zixin","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,10]]},"reference":[{"key":"14_CR1","doi-asserted-by":"publisher","unstructured":"Behley, J., Garbade, M., Milioto, A., Quenzel, J., Behnke, S., Stachniss, C., Gall, J.: Semantickitti: A dataset for semantic scene understanding of lidar sequences. In: ICCV. pp. 9297\u20139307 (2019). https:\/\/doi.org\/10.1109\/ICCV.2019.00939","DOI":"10.1109\/ICCV.2019.00939"},{"key":"14_CR2","doi-asserted-by":"publisher","unstructured":"Berman, M., Triki, A.R., Blaschko, M.B.: The lovasz-softmax loss: A tractable surrogate for the optimization of the intersection-over-union measure in neural networks. In: CVPR. pp. 4413\u20134421 (2018).https:\/\/doi.org\/10.1109\/CVPR.2018.00464","DOI":"10.1109\/CVPR.2018.00464"},{"key":"14_CR3","doi-asserted-by":"publisher","unstructured":"Caesar, H., Bankiti, V., Lang, A.H., Vora, S., Liong, V.E., Xu, Q., Krishnan, A., Pan, Y., Baldan, G., Beijbom, O.: nuscenes: A multimodal dataset for autonomous driving. In: CVPR. pp. 11618\u201311628 (2020).https:\/\/doi.org\/10.1109\/CVPR42600.2020.01164","DOI":"10.1109\/CVPR42600.2020.01164"},{"key":"14_CR4","doi-asserted-by":"publisher","unstructured":"Cao, A., de\u00a0Charette, R.: Monoscene: Monocular 3d semantic scene completion. In: CVPR. pp. 3981\u20133991 (2022https:\/\/doi.org\/10.1109\/CVPR52688.2022.00396","DOI":"10.1109\/CVPR52688.2022.00396"},{"key":"14_CR5","doi-asserted-by":"publisher","unstructured":"Chang, M.F., Lambert, J., Sangkloy, P., Singh, J., Bak, S., Hartnett, A., Wang, D., Carr, P., Lucey, S., Ramanan, D., Hays, J.: Argoverse: 3d tracking and forecasting with rich maps. In: CVPR. pp. 8748\u20138757 (2019).https:\/\/doi.org\/10.1109\/CVPR.2019.00895","DOI":"10.1109\/CVPR.2019.00895"},{"key":"14_CR6","doi-asserted-by":"publisher","unstructured":"Chen, X., Lin, K., Qian, C., Zeng, G., Li, H.: 3d sketch-aware semantic scene completion via semi-supervised structure prior. In: CVPR. pp. 4192\u20134201 (2020https:\/\/doi.org\/10.1109\/CVPR42600.2020.00425","DOI":"10.1109\/CVPR42600.2020.00425"},{"key":"14_CR7","doi-asserted-by":"publisher","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: Imagenet: A large-scale hierarchical image database. In: CVPR. pp. 248\u2013255 (2009).https:\/\/doi.org\/10.1109\/CVPR.2009.5206848","DOI":"10.1109\/CVPR.2009.5206848"},{"issue":"9","key":"14_CR8","doi-asserted-by":"publisher","first-page":"1627","DOI":"10.1109\/TPAMI.2009.167","volume":"32","author":"PF Felzenszwalb","year":"2010","unstructured":"Felzenszwalb, P.F., Girshick, R.B., McAllester, D.A., Ramanan, D.: Object detection with discriminatively trained part-based models. IEEE Trans. Pattern Anal. Mach. Intell. 32(9), 1627\u20131645 (2010). https:\/\/doi.org\/10.1109\/TPAMI.2009.167","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"14_CR9","doi-asserted-by":"publisher","unstructured":"Firman, M., Aodha, O.M., Julier, S., Brostow, G.J.: Structured prediction of unobserved voxels from a single depth image. In: CVPR. pp. 5431\u20135440 (2016).https:\/\/doi.org\/10.1109\/CVPR.2016.586","DOI":"10.1109\/CVPR.2016.586"},{"key":"14_CR10","unstructured":"Gal, Y., Islam, R., Ghahramani, Z.: Deep bayesian active learning with image data. In: ICML. pp. 1183\u20131192 (2017)"},{"key":"14_CR11","doi-asserted-by":"publisher","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: CVPR. pp. 770\u2013778 (2016https:\/\/doi.org\/10.1109\/CVPR.2016.90","DOI":"10.1109\/CVPR.2016.90"},{"key":"14_CR12","unstructured":"Houlsby, N., Huszar, F., Ghahramani, Z., Lengyel, M.: Bayesian active learning for classification and preference learning. aeXiv preprint arXiv:1112.5745 (2011)"},{"key":"14_CR13","doi-asserted-by":"publisher","unstructured":"Hua, B.S., Pham, Q.H., Nguyen, D.T., Tran, M.K., Yu, L.F., Yeung, S.K.: Scenenn: A scene meshes dataset with annotations. In: 3DV. pp. 92\u2013101 (2016).https:\/\/doi.org\/10.1109\/3DV.2016.18","DOI":"10.1109\/3DV.2016.18"},{"key":"14_CR14","doi-asserted-by":"publisher","unstructured":"Huang, J., Huang, G.: Bevdet4d: Exploit temporal cues in multi-camera 3d object detection. CoRR abs\/2203.17054 (2022).https:\/\/doi.org\/10.48550\/ARXIV.2203.17054","DOI":"10.48550\/ARXIV.2203.17054"},{"key":"14_CR15","unstructured":"Huang, J., Huang, G., Zhu, Z., Du, D.: Bevdet: High-performance multi-camera 3d object detection in bird-eye-view. aeXiv preprint arXiv:2112.11790 (2021)"},{"key":"14_CR16","doi-asserted-by":"publisher","unstructured":"Huang, Y., Zheng, W., Zhang, Y., Zhou, J., Lu, J.: Tri-perspective view for vision-based 3d semantic occupancy prediction. In: CVPR. pp. 9223\u20139232 (2023).https:\/\/doi.org\/10.1109\/CVPR52729.2023.00890","DOI":"10.1109\/CVPR52729.2023.00890"},{"key":"14_CR17","doi-asserted-by":"publisher","unstructured":"Kim, J., Choi, J., Kim, Y., Koh, J., Chung, C.C., Choi, J.W.: Robust camera lidar sensor fusion via deep gated information fusion network. In: IV. pp. 1620\u20131625 (2018).https:\/\/doi.org\/10.1109\/IVS.2018.8500711","DOI":"10.1109\/IVS.2018.8500711"},{"key":"14_CR18","unstructured":"Kingma, D.P., Ba, J.: Adam: A method for stochastic optimization. In: ICLR (2015)"},{"key":"14_CR19","unstructured":"Kirsch, A., van Amersfoort, J., Gal, Y.: Batchbald: Efficient and diverse batch acquisition for deep bayesian active learning. In: NeurIPS. pp. 7024\u20137035 (2019)"},{"key":"14_CR20","doi-asserted-by":"publisher","unstructured":"Li, J., Han, K., Wang, P., Liu, Y., Yuan, X.: Anisotropic convolutional networks for 3d semantic scene completion. In: CVPR. pp. 3348\u20133356 (2020).https:\/\/doi.org\/10.1109\/CVPR42600.2020.00341","DOI":"10.1109\/CVPR42600.2020.00341"},{"key":"14_CR21","doi-asserted-by":"publisher","unstructured":"Li, Y., Yu, Z., Choy, C.B., Xiao, C., \u00c1lvarez, J.M., Fidler, S., Feng, C., Anandkumar, A.: Voxformer: Sparse voxel transformer for camera-based 3d semantic scene completion. In: CVPR. pp. 9087\u20139098 (2023).https:\/\/doi.org\/10.1109\/CVPR52729.2023.00877","DOI":"10.1109\/CVPR52729.2023.00877"},{"key":"14_CR22","doi-asserted-by":"publisher","unstructured":"Li, Y., Yu, A.W., Meng, T., Caine, B., Ngiam, J., Peng, D., Shen, J., Lu, Y., Zhou, D., Le, Q.V., Yuille, A.L., Ta, M.: Deepfusion: Lidar-camera deep fusion for multi-modal 3d object detection. In: CVPR. pp. 17161\u201317170 (2022).https:\/\/doi.org\/10.1109\/CVPR52688.2022.01667","DOI":"10.1109\/CVPR52688.2022.01667"},{"key":"14_CR23","doi-asserted-by":"publisher","unstructured":"Li, Y., Bao, H., Ge, Z., Yang, J., Sun, J., Li, Z.: Bevstereo: Enhancing depth estimation in multi-view 3d object detection with temporal stereo. In: Williams, B., Chen, Y., Neville, J. (eds.) AAAI. pp. 1486\u20131494. AAAI Press (2023).https:\/\/doi.org\/10.1609\/AAAI.V37I2.25234","DOI":"10.1609\/AAAI.V37I2.25234"},{"key":"14_CR24","doi-asserted-by":"publisher","unstructured":"Li, Z., Wang, W., Li, H., Xie, E., Sima, C., Lu, T., Yu, Q., Dai, J.: Bevformer: Learning bird\u2019s-eye-view representation from multi-camera images via spatiotemporal transformers. In: ECCV. pp. 1\u201318 (2022).https:\/\/doi.org\/10.1007\/978-3-031-20077-9_1","DOI":"10.1007\/978-3-031-20077-9_1"},{"key":"14_CR25","doi-asserted-by":"publisher","unstructured":"Li, Z., Yu, Z., Austin, D., Fang, M., Lan, S., Kautz, J., \u00c1lvarez, J.M.: FB-OCC: 3d occupancy prediction based on forward-backward view transformation. CoRR abs\/2307.01492 (2023).https:\/\/doi.org\/10.48550\/ARXIV.2307.01492","DOI":"10.48550\/ARXIV.2307.01492"},{"key":"14_CR26","doi-asserted-by":"publisher","unstructured":"Li, Z., Yu, Z., Austin, D., Fang, M., Lan, S., Kautz, J., \u00c1lvarez, J.M.: Fb-occ: 3d occupancy prediction based on forward-backward view transformation. aeXiv preprint arXIv:2307.01492 (2023).https:\/\/doi.org\/10.48550\/arXiv.2307.01492","DOI":"10.48550\/arXiv.2307.01492"},{"key":"14_CR27","doi-asserted-by":"publisher","unstructured":"Lin, T., Doll\u00e1r, P., Girshick, R.B., He, K., Hariharan, B., Belongie, S.J.: Feature pyramid networks for object detection. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2017, Honolulu, HI, USA, July 21-26, 2017. pp. 936\u2013944. IEEE Computer Society (2017).https:\/\/doi.org\/10.1109\/CVPR.2017.106","DOI":"10.1109\/CVPR.2017.106"},{"key":"14_CR28","doi-asserted-by":"publisher","unstructured":"Lin, T., Goyal, P., Girshick, R.B., He, K., Doll\u00e1r, P.: Focal loss for dense object detection. In: ICCV. pp. 2999\u20133007. IEEE Computer Society (2017).https:\/\/doi.org\/10.1109\/ICCV.2017.324","DOI":"10.1109\/ICCV.2017.324"},{"key":"14_CR29","doi-asserted-by":"publisher","unstructured":"Liu, P., Wang, L., Ranjan, R., He, G., Zhao, L.: A survey on active deep learning: From model driven to data driven. ACM Comput. Surv. 54(10s), 221:1\u2013221:34 (2022).https:\/\/doi.org\/10.1145\/3510414","DOI":"10.1145\/3510414"},{"key":"14_CR30","doi-asserted-by":"publisher","unstructured":"Liu, Y., Wang, T., Zhang, X., Sun, J.: Petr: Position embedding transformation for multi-view 3d object detection. In: ECCV. pp. 531\u2013548 (2022).https:\/\/doi.org\/10.1007\/978-3-031-19812-0_31","DOI":"10.1007\/978-3-031-19812-0_31"},{"key":"14_CR31","doi-asserted-by":"publisher","unstructured":"Liu, Z., Tang, H., Amini, A., Yang, X., Mao, H., Rus, D.L., Han, S.: Bevfusion: Multi-task multi-sensor fusion with unified bird\u2019s-eye view representation. In: IEEE International Conference on Robotics and Automation, ICRA 2023, London, UK, May 29 - June 2, 2023. pp. 2774\u20132781 (2023)https:\/\/doi.org\/10.1109\/ICRA48891.2023.10160968","DOI":"10.1109\/ICRA48891.2023.10160968"},{"key":"14_CR32","doi-asserted-by":"publisher","unstructured":"Lu, Y., Zhu, X., Wang, T., Ma, Y.: Octreeocc: Efficient and multi-granularity occupancy prediction using octree queries. CoRR abs\/2312.03774 (2023).https:\/\/doi.org\/10.48550\/ARXIV.2312.03774","DOI":"10.48550\/ARXIV.2312.03774"},{"key":"14_CR33","doi-asserted-by":"publisher","unstructured":"Miao, R., Liu, W., Chen, M., Gong, Z., Xu, W., Hu, C., Zhou, S.: Occdepth: A depth-aware method for 3d semantic scene completion. arXiv preprint arXiv:2302.13540 (2023).https:\/\/doi.org\/10.48550\/arXiv.2302.13540","DOI":"10.48550\/arXiv.2302.13540"},{"key":"14_CR34","doi-asserted-by":"publisher","unstructured":"Min, C., Xiao, L., Zhao, D., Nie, Y., Dai, B.: Uniscene: Multi-camera unified pre-training via 3d scene reconstruction. arXiv preprint arXiv:2305.18829 (2023).https:\/\/doi.org\/10.48550\/arXiv.2305.18829","DOI":"10.48550\/arXiv.2305.18829"},{"key":"14_CR35","doi-asserted-by":"publisher","unstructured":"Ming, Z., Berrio, J.S., Shan, M., Worrall, S.: Occfusion: A straightforward and effective multi-sensor fusion framework for 3d occupancy prediction. CoRR abs\/2403.01644 (2024).https:\/\/doi.org\/10.48550\/ARXIV.2403.01644","DOI":"10.48550\/ARXIV.2403.01644"},{"issue":"6","key":"14_CR36","doi-asserted-by":"publisher","first-page":"5687","DOI":"10.1109\/LRA.2024.3396092","volume":"9","author":"J Pan","year":"2024","unstructured":"Pan, J., Wang, Z., Wang, L.: Co-occ: Coupling explicit feature fusion with volume rendering regularization for multi-modal 3d semantic occupancy prediction. IEEE Robotics Autom. Lett. 9(6), 5687\u20135694 (2024). https:\/\/doi.org\/10.1109\/LRA.2024.3396092","journal-title":"IEEE Robotics Autom. Lett."},{"key":"14_CR37","doi-asserted-by":"publisher","unstructured":"Pan, M., Liu, J., Zhang, R., Huang, P., Li, X., Liu, L., Zhang, S.: Renderocc: Vision-centric 3d occupancy prediction with 2d rendering supervision. CoRR abs\/2309.09502 (2023).https:\/\/doi.org\/10.48550\/ARXIV.2309.09502","DOI":"10.48550\/ARXIV.2309.09502"},{"key":"14_CR38","doi-asserted-by":"publisher","unstructured":"Philion, J., Fidler, S.: Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly unprojecting to 3d. In: ECCV. pp. 194\u2013210 (2020).https:\/\/doi.org\/10.1007\/978-3-030-58568-6_12","DOI":"10.1007\/978-3-030-58568-6_12"},{"key":"14_CR39","doi-asserted-by":"publisher","unstructured":"Qi, C.R., Zhou, Y., Najibi, M., Sun, P., Vo, K., Deng, B., Anguelov, D.: Offboard 3d object detection from point cloud sequences. In: CVPR. pp. 6134\u20136144 (2021).https:\/\/doi.org\/10.1109\/CVPR46437.2021.00607","DOI":"10.1109\/CVPR46437.2021.00607"},{"key":"14_CR40","unstructured":"Qi, C.R., Yi, L., Su, H., Guibas, L.J.: Pointnet++: Deep hierarchical feature learning on point sets in a metric space. In: NeurIPS. pp. 5099\u20135108 (2017)"},{"key":"14_CR41","doi-asserted-by":"publisher","unstructured":"Reading, C., Harakeh, A., Chae, J., Waslander, S.L.: Categorical depth distribution network for monocular 3d object detection. In: CVPR. pp. 8555\u20138564 (2021).https:\/\/doi.org\/10.1109\/CVPR46437.2021.00845","DOI":"10.1109\/CVPR46437.2021.00845"},{"key":"14_CR42","doi-asserted-by":"publisher","unstructured":"Rold\u00e3o, L., de\u00a0Charette, R., Verroust-Blondet, A.: Lmscnet: Lightweight multiscale 3d semantic completion. In: 3DV. pp. 111\u2013119 (2020).https:\/\/doi.org\/10.1109\/3DV50981.2020.00021","DOI":"10.1109\/3DV50981.2020.00021"},{"key":"14_CR43","doi-asserted-by":"publisher","unstructured":"Shrivastava, A., Gupta, A., Girshick, R.B.: Training region-based object detectors with online hard example mining. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016, Las Vegas, NV, USA, June 27-30, 2016. pp. 761\u2013769 (2016).https:\/\/doi.org\/10.1109\/CVPR.2016.89","DOI":"10.1109\/CVPR.2016.89"},{"key":"14_CR44","unstructured":"Sung, K.K.: Learning and example selection for object and pattern detection. Ph.D. thesis, Massachusetts Institute of Technology, Cambridge, MA, USA (1995), https:\/\/hdl.handle.net\/1721.1\/9836"},{"key":"14_CR45","unstructured":"Tian, X., Jiang, T., Yun, L., Mao, Y., Yang, H., Wang, Y., Wang, Y., Zhao, H.: Occ3d: A large-scale 3d occupancy prediction benchmark for autonomous driving. In: NeurIPS. pp. 64318\u201364330 (2023)"},{"key":"14_CR46","doi-asserted-by":"publisher","unstructured":"Vobecky, A., Sim\u00e9oni, O., Hurych, D., Gidaris, S., Bursuc, A., P\u00e9rez, P., Sivic, J.: Pop-3d: Open-vocabulary 3d occupancy prediction from images. arXiv preprint arXiv:2401.09413 (2024).https:\/\/doi.org\/10.48550\/arXiv.2401.09413","DOI":"10.48550\/arXiv.2401.09413"},{"key":"14_CR47","doi-asserted-by":"publisher","unstructured":"Vora, S., Lang, A.H., Helou, B., Beijbom, O.: Pointpainting: Sequential fusion for 3d object detection. In: CVPR. pp. 4603\u20134611 (2020).https:\/\/doi.org\/10.1109\/CVPR42600.2020.00466","DOI":"10.1109\/CVPR42600.2020.00466"},{"key":"14_CR48","doi-asserted-by":"publisher","unstructured":"Wang, X., Zhu, Z., Xu, W., Zhang, Y., Wei, Y., Chi, X., Ye, Y., Du, D., Lu, J., Wang, X.: Openoccupancy: A large scale benchmark for surrounding semantic occupancy perception. In: ICCV. pp. 17804\u201317813 (2023).https:\/\/doi.org\/10.1109\/ICCV51070.2023.01636","DOI":"10.1109\/ICCV51070.2023.01636"},{"key":"14_CR49","doi-asserted-by":"publisher","unstructured":"Wang, Y., Chao, W.L., Garg, D., Hariharan, B., Campbell, M., Weinberger, K.Q.: Pseudo-lidar from visual depth estimation: Bridging the gap in 3d object detection for autonomous driving. In: CVPR. pp. 8445\u20138453 (2019).https:\/\/doi.org\/10.1109\/CVPR.2019.00864","DOI":"10.1109\/CVPR.2019.00864"},{"key":"14_CR50","doi-asserted-by":"publisher","unstructured":"Wang, Y., Chen, Y., Liao, X., Fan, L., Zhang, Z.: Panoocc: Unified occupancy representation for camera-based 3d panoptic segmentation. CoRR abs\/2306.10013 (2023).https:\/\/doi.org\/10.48550\/ARXIV.2306.10013","DOI":"10.48550\/ARXIV.2306.10013"},{"key":"14_CR51","doi-asserted-by":"publisher","unstructured":"Wei, Y., Zhao, L., Zheng, W., Zhu, Z., Zhou, J., Lu, J.: Surroundocc: Multi-camera 3d occupancy prediction for autonomous driving. In: ICCV. pp. 21672\u201321683 (2023).https:\/\/doi.org\/10.1109\/ICCV51070.2023.01986","DOI":"10.1109\/ICCV51070.2023.01986"},{"key":"14_CR52","doi-asserted-by":"publisher","unstructured":"Yan, X., Gao, J., Li, J., Zhang, R., Li, Z., Huang, R., Cui, S.: Sparse single sweep lidar point cloud segmentation via learning contextual shape priors from scene completion. In: AAAI. pp. 3101\u20133109 (2021).https:\/\/doi.org\/10.1609\/AAAI.V35I4.16419","DOI":"10.1609\/AAAI.V35I4.16419"},{"key":"14_CR53","doi-asserted-by":"publisher","unstructured":"Yan, Y., Mao, Y., Li, B.: Second: Sparsely embedded convolutional detection. Sensors 18(10) (2018).https:\/\/doi.org\/10.3390\/S18103337","DOI":"10.3390\/S18103337"},{"key":"14_CR54","doi-asserted-by":"publisher","unstructured":"Yang, C., Chen, Y., Tian, H., Tao, C., Zhu, X., Zhang, Z., Huang, G., Li, H., Qiao, Y., Lu, L., Zhou, J., Dai, J.: Bevformer v2: Adapting modern image backbones to bird\u2019s-eye-view recognition via perspective supervision. In: CVPR. pp. 17830\u201317839 (2023).https:\/\/doi.org\/10.1109\/CVPR52729.2023.01710","DOI":"10.1109\/CVPR52729.2023.01710"},{"key":"14_CR55","unstructured":"Yin, T., Zhou, X., Kr\u00e4henb\u00fchl, P.: Multimodal virtual point 3d detection. In: NeurIPS. pp. 16494\u201316507 (2021)"},{"key":"14_CR56","doi-asserted-by":"publisher","unstructured":"Zhang, C., Yan, J., Wei, Y., Li, J., Liu, L., Tang, Y., Duan, Y., Lu, J.: Occnerf: Self-supervised multi-camera occupancy prediction with neural radiance fields. arXiv preprint arXiv:2312.09243 (2023).https:\/\/doi.org\/10.48550\/arXiv.2312.09243","DOI":"10.48550\/arXiv.2312.09243"},{"key":"14_CR57","doi-asserted-by":"publisher","unstructured":"Zhang, Y., Zheng, W., Zhu, Z., Huang, G., Lu, J., Zhou, J.: A simple baseline for multi-camera 3d object detection. In: AAAI. pp. 3507\u20133515 (2023).https:\/\/doi.org\/10.1609\/aaai.v37i3.25460","DOI":"10.1609\/aaai.v37i3.25460"},{"key":"14_CR58","doi-asserted-by":"publisher","unstructured":"Zhang, Y., Zhu, Z., Du, D.: Occformer: Dual-path transformer for vision-based 3d semantic occupancy prediction. In: ICCV. pp. 9399\u20139409 (2023).https:\/\/doi.org\/10.1109\/ICCV51070.2023.00865","DOI":"10.1109\/ICCV51070.2023.00865"},{"key":"14_CR59","doi-asserted-by":"publisher","unstructured":"Zhou, B., Kr\u00e4henb\u00fchl, P.: Cross-view transformers for real-time map-view semantic segmentation. In: CVPR. pp. 13750\u201313759 (2022).https:\/\/doi.org\/10.1109\/CVPR52688.2022.01339","DOI":"10.1109\/CVPR52688.2022.01339"},{"key":"14_CR60","doi-asserted-by":"publisher","unstructured":"Zhou, Y., Tuzel, O.: Voxelnet: End-to-end learning for point cloud based 3d object detection. In: CVPR. pp. 4490\u20134499 (2018).https:\/\/doi.org\/10.1109\/CVPR.2018.00472","DOI":"10.1109\/CVPR.2018.00472"},{"key":"14_CR61","unstructured":"Zhu, X., Su, W., Lu, L., Li, B., Wang, X., Dai, J.: Deformable detr: Deformable transformers for end-to-end object detection. In: ICLR (2021)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ACCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-96-0972-7_14","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,9]],"date-time":"2024-12-09T09:07:34Z","timestamp":1733735254000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-96-0972-7_14"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,10]]},"ISBN":["9789819609710","9789819609727"],"references-count":61,"URL":"https:\/\/doi.org\/10.1007\/978-981-96-0972-7_14","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,10]]},"assertion":[{"value":"10 December 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ACCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Asian Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Hanoi","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Vietnam","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"12 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"accv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}