{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T14:49:55Z","timestamp":1784299795534,"version":"3.55.0"},"publisher-location":"Cham","reference-count":55,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031731129","type":"print"},{"value":"9783031731136","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,21]],"date-time":"2024-11-21T00:00:00Z","timestamp":1732147200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,21]],"date-time":"2024-11-21T00:00:00Z","timestamp":1732147200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-73113-6_14","type":"book-chapter","created":{"date-parts":[[2024,11,20]],"date-time":"2024-11-20T08:52:11Z","timestamp":1732092731000},"page":"232-249","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":17,"title":["Diffusion Model for\u00a0Robust Multi-sensor Fusion in\u00a03D Object Detection and\u00a0BEV Segmentation"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2356-4530","authenticated-orcid":false,"given":"Duy-Tho","family":"Le","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1340-0009","authenticated-orcid":false,"given":"Hengcan","family":"Shi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9444-3763","authenticated-orcid":false,"given":"Jianfei","family":"Cai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8659-8773","authenticated-orcid":false,"given":"Hamid","family":"Rezatofighi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,11,21]]},"reference":[{"key":"14_CR1","doi-asserted-by":"crossref","unstructured":"Bai, X., et al.: TransFusion: robust LiDAR-camera fusion for 3D object detection with transformers. In: CVPR, pp. 1090\u20131099 (2022)","DOI":"10.1109\/CVPR52688.2022.00116"},{"key":"14_CR2","doi-asserted-by":"crossref","unstructured":"Caesar, H., et al.: nuScenes: a multimodal dataset for autonomous driving. In: CVPR, pp. 11621\u201311631 (2020)","DOI":"10.1109\/CVPR42600.2020.01164"},{"key":"14_CR3","doi-asserted-by":"crossref","unstructured":"Chen, S., Sun, P., Song, Y., Luo, P.: DiffusionDet: diffusion model for object detection. In: ICCV, pp. 19830\u201319843 (2023)","DOI":"10.1109\/ICCV51070.2023.01816"},{"key":"14_CR4","doi-asserted-by":"crossref","unstructured":"Chen, X., Zhang, T., Wang, Y., Wang, Y., Zhao, H.: FUTR3D: a unified sensor fusion framework for 3D detection. In: CVPR, pp. 172\u2013181 (2023)","DOI":"10.1109\/CVPRW59228.2023.00022"},{"key":"14_CR5","doi-asserted-by":"crossref","unstructured":"Chen, Y., et al.: FocalFormer3D: focusing on hard instance for 3D object detection. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 8394\u20138405 (2023)","DOI":"10.1109\/ICCV51070.2023.00771"},{"key":"14_CR6","doi-asserted-by":"crossref","unstructured":"Chen, Y., Li, Y., Zhang, X., Sun, J., Jia, J.: Focal sparse convolutional networks for 3D object detection. In: CVPR, pp. 5428\u20135437 (2022)","DOI":"10.1109\/CVPR52688.2022.00535"},{"key":"14_CR7","doi-asserted-by":"crossref","unstructured":"Chen, Y., Liu, J., Zhang, X., Qi, X., Jia, J.: LargeKernel3D: scaling up kernels in 3D sparse CNNs. In: CVPR, pp. 13488\u201313498 (2023)","DOI":"10.1109\/CVPR52729.2023.01296"},{"key":"14_CR8","doi-asserted-by":"crossref","unstructured":"Fan, L., Xiong, X., Wang, F., Wang, N., Zhang, Z.: RangeDet: in defense of range view for LiDAR-based 3D object detection. In: ICCV, pp. 2918\u20132927 (2021)","DOI":"10.1109\/ICCV48922.2021.00291"},{"key":"14_CR9","first-page":"6840","volume":"33","author":"J Ho","year":"2020","unstructured":"Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. NeurIPS 33, 6840\u20136851 (2020)","journal-title":"NeurIPS"},{"key":"14_CR10","doi-asserted-by":"crossref","unstructured":"Jiang, C., et al.: MotionDiffuser: controllable multi-agent motion prediction using diffusion. In: CVPR, pp. 9644\u20139653 (2023)","DOI":"10.1109\/CVPR52729.2023.00930"},{"key":"14_CR11","doi-asserted-by":"crossref","unstructured":"Jiao, Y., Jie, Z., Chen, S., Chen, J., Ma, L., Jiang, Y.G.: MSMDFusion: fusing LiDAR and camera at multiple scales with multi-depth seeds for 3D object detection. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 21643\u201321652 (2023)","DOI":"10.1109\/CVPR52729.2023.02073"},{"key":"14_CR12","doi-asserted-by":"crossref","unstructured":"Lang, A.H., Vora, S., Caesar, H., Zhou, L., Yang, J., Beijbom, O.: PointPillars: fast encoders for object detection from point clouds. In: CVPR, pp. 12697\u201312705 (2019)","DOI":"10.1109\/CVPR.2019.01298"},{"issue":"2","key":"14_CR13","first-page":"1159","volume":"8","author":"DT Le","year":"2022","unstructured":"Le, D.T., Shi, H., Rezatofighi, H., Cai, J.: Accurate and real-time 3D pedestrian detection using an efficient attentive pillar network. RA-L 8(2), 1159\u20131166 (2022)","journal-title":"RA-L"},{"key":"14_CR14","first-page":"18442","volume":"35","author":"Y Li","year":"2022","unstructured":"Li, Y., Chen, Y., Qi, X., Li, Z., Sun, J., Jia, J.: Unifying voxel-based representation with transformer for 3D object detection. NeurIPS 35, 18442\u201318455 (2022)","journal-title":"NeurIPS"},{"key":"14_CR15","doi-asserted-by":"crossref","unstructured":"Li, Y., et al.: BEVDepth: acquisition of reliable depth for multi-view 3D object detection. In: AAAI, vol.\u00a037, pp. 1477\u20131485 (2023)","DOI":"10.1609\/aaai.v37i2.25233"},{"key":"14_CR16","doi-asserted-by":"publisher","unstructured":"Li, Z., et al.: BevFormer: learning bird\u2019s-eye-view representation from multi-camera images via spatiotemporal transformers. In: Avidan, S., Brostow, G., Cisse, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision \u2013 ECCV 2022. ECCV 2022. LNCS, vol. 13669, pp. 1\u201318. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-20077-9_1","DOI":"10.1007\/978-3-031-20077-9_1"},{"key":"14_CR17","first-page":"10421","volume":"35","author":"T Liang","year":"2022","unstructured":"Liang, T., et al.: BEVFusion: a simple and robust lidar-camera fusion framework. NeurIPS 35, 10421\u201310434 (2022)","journal-title":"NeurIPS"},{"key":"14_CR18","doi-asserted-by":"crossref","unstructured":"Lin, C.H., et al.: Magic3D: high-resolution text-to-3D content creation. In: CVPR, pp. 300\u2013309 (2023)","DOI":"10.1109\/CVPR52729.2023.00037"},{"key":"14_CR19","doi-asserted-by":"crossref","unstructured":"Liu, R., Wu, R., Van\u00a0Hoorick, B., Tokmakov, P., Zakharov, S., Vondrick, C.: Zero-1-to-3: zero-shot one image to 3D object. In: ICCV, pp. 9298\u20139309 (2023)","DOI":"10.1109\/ICCV51070.2023.00853"},{"key":"14_CR20","doi-asserted-by":"crossref","unstructured":"Liu, Z., et al.: Swin transformer: hierarchical vision transformer using shifted windows. In: ICCV, pp. 10012\u201310022 (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"14_CR21","doi-asserted-by":"crossref","unstructured":"Liu, Z., Zhao, X., Huang, T., Hu, R., Zhou, Y., Bai, X.: TANet: robust 3D object detection from point clouds with triple attention. In: AAAI, vol.\u00a034, pp. 11677\u201311684 (2020)","DOI":"10.1609\/aaai.v34i07.6837"},{"key":"14_CR22","doi-asserted-by":"crossref","unstructured":"Liu, Z., et al.: BEVFusion: multi-task multi-sensor fusion with unified bird\u2019s-eye view representation. In: 2023 IEEE International Conference on Robotics and Automation (ICRA), pp. 2774\u20132781. IEEE (2023)","DOI":"10.1109\/ICRA48891.2023.10160968"},{"key":"14_CR23","unstructured":"Loshchilov, I., Hutter, F.: SGDR: stochastic gradient descent with warm restarts. arXiv preprint arXiv:1608.03983 (2016)"},{"key":"14_CR24","unstructured":"Loshchilov, I., Hutter, F.: Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101 (2017)"},{"key":"14_CR25","unstructured":"Lu, C., Zhou, Y., Bao, F., Chen, J., Li, C., Zhu, J.: DPM-Solver++: fast solver for guided sampling of diffusion probabilistic models. arXiv preprint arXiv:2211.01095 (2022)"},{"key":"14_CR26","doi-asserted-by":"crossref","unstructured":"Lu, T., Ding, X., Liu, H., Wu, G., Wang, L.: Link: linear kernel for LiDAR-based 3D perception. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 1105\u20131115 (2023)","DOI":"10.1109\/CVPR52729.2023.00113"},{"key":"14_CR27","doi-asserted-by":"crossref","unstructured":"Paigwar, A., Sierra-Gonzalez, D., Erkent, \u00d6., Laugier, C.: Frustum-PointPillars: a multi-stage approach for 3D object detection using RGB camera and LiDAR. In: ICCV, pp. 2926\u20132933 (2021)","DOI":"10.1109\/ICCVW54120.2021.00327"},{"key":"14_CR28","doi-asserted-by":"crossref","unstructured":"Pang, S., Morris, D., Radha, H.: CLOCs: camera-LiDAR object candidates fusion for 3D object detection. In: IROS, pp. 10386\u201310393. IEEE (2020)","DOI":"10.1109\/IROS45743.2020.9341791"},{"key":"14_CR29","doi-asserted-by":"crossref","unstructured":"Pang, S., Morris, D., Radha, H.: Fast-CLOCs: fast camera-LiDAR object candidates fusion for 3D object detection. In: WACV, pp. 187\u2013196 (2022)","DOI":"10.1109\/WACV51458.2022.00380"},{"key":"14_CR30","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"194","DOI":"10.1007\/978-3-030-58568-6_12","volume-title":"Computer Vision \u2013 ECCV 2020","author":"J Philion","year":"2020","unstructured":"Philion, J., Fidler, S.: Lift, Splat, Shoot: encoding images from arbitrary camera rigs by implicitly unprojecting to 3D. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12359, pp. 194\u2013210. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58568-6_12"},{"key":"14_CR31","unstructured":"Poole, B., Jain, A., Barron, J.T., Mildenhall, B.: DreamFusion: text-to-3D using 2D diffusion. arXiv preprint arXiv:2209.14988 (2022)"},{"key":"14_CR32","doi-asserted-by":"crossref","unstructured":"Qi, C.R., Liu, W., Wu, C., Su, H., Guibas, L.J.: Frustum PointNets for 3D object detection from RGB-D data. In: CVPR, pp. 918\u2013927 (2018)","DOI":"10.1109\/CVPR.2018.00102"},{"key":"14_CR33","unstructured":"Qi, C.R., Su, H., Mo, K., Guibas, L.J.: PointNet: deep learning on point sets for 3D classification and segmentation. In: CVPR, pp. 652\u2013660 (2017)"},{"key":"14_CR34","doi-asserted-by":"crossref","unstructured":"Simon, M., et al.: Complexer-YOLO: real-time 3D object detection and tracking on semantic point clouds. In: CVPR Workshops (2019)","DOI":"10.1109\/CVPRW.2019.00158"},{"key":"14_CR35","doi-asserted-by":"crossref","unstructured":"Smith, L.N., Topin, N.: Super-convergence: very fast training of neural networks using large learning rates. In: Artificial Intelligence and Machine Learning for Multi-domain Operations Applications, vol. 11006, pp. 369\u2013386. SPIE (2019)","DOI":"10.1117\/12.2520589"},{"key":"14_CR36","unstructured":"Song, J., Meng, C., Ermon, S.: Denoising diffusion implicit models. arXiv preprint arXiv:2010.02502 (2020)"},{"key":"14_CR37","doi-asserted-by":"crossref","unstructured":"Sun, P., et al.: RSN: range sparse net for efficient, accurate LiDAR 3D object detection. In: CVPR, pp. 5725\u20135734 (2021)","DOI":"10.1109\/CVPR46437.2021.00567"},{"key":"14_CR38","doi-asserted-by":"crossref","unstructured":"Tan, M., Pang, R., Le, Q.V.: EfficientDet: scalable and efficient object detection. In: CVPR, pp. 10781\u201310790 (2020)","DOI":"10.1109\/CVPR42600.2020.01079"},{"key":"14_CR39","doi-asserted-by":"crossref","unstructured":"Vora, S., Lang, A.H., Helou, B., Beijbom, O.: PointPainting: sequential fusion for 3D object detection. In: CVPR, pp. 4604\u20134612 (2020)","DOI":"10.1109\/CVPR42600.2020.00466"},{"key":"14_CR40","doi-asserted-by":"crossref","unstructured":"Wang, C., Ma, C., Zhu, M., Yang, X.: PointAugmenting: cross-modal augmentation for 3D object detection. In: CVPR, pp. 11794\u201311803 (2021)","DOI":"10.1109\/CVPR46437.2021.01162"},{"key":"14_CR41","unstructured":"Wang, T., Xinge, Z., Pang, J., Lin, D.: Probabilistic and geometric depth: detecting objects in perspective. In: Conference on Robot Learning, pp. 1475\u20131485. PMLR (2022)"},{"key":"14_CR42","doi-asserted-by":"crossref","unstructured":"Wang, T., Zhu, X., Pang, J., Lin, D.: FCOS3D: fully convolutional one-stage monocular 3D object detection. In: ICCV, pp. 913\u2013922 (2021)","DOI":"10.1109\/ICCVW54120.2021.00107"},{"key":"14_CR43","unstructured":"Wang, Y., Guizilini, V.C., Zhang, T., Wang, Y., Zhao, H., Solomon, J.: DETR3D: 3D object detection from multi-view images via 3D-to-2D queries. In: Conference on Robot Learning, pp. 180\u2013191. PMLR (2022)"},{"key":"14_CR44","unstructured":"Xie, E., et al.: M$$^2$$BEV: multi-camera joint 3D detection and segmentation with unified birds-eye view representation. arXiv preprint arXiv:2204.05088 (2022)"},{"key":"14_CR45","doi-asserted-by":"crossref","unstructured":"Xu, S., Zhou, D., Fang, J., Yin, J., Bin, Z., Zhang, L.: FusionPainting: multimodal fusion with adaptive attention for 3D object detection. In: ITSC, pp. 3047\u20133054. IEEE (2021)","DOI":"10.1109\/ITSC48978.2021.9564951"},{"key":"14_CR46","doi-asserted-by":"crossref","unstructured":"Yan, J., et al.: Cross modal transformer: towards fast and robust 3D object detection. In: ICCV, pp. 18268\u201318278 (2023)","DOI":"10.1109\/ICCV51070.2023.01675"},{"issue":"10","key":"14_CR47","doi-asserted-by":"publisher","first-page":"3337","DOI":"10.3390\/s18103337","volume":"18","author":"Y Yan","year":"2018","unstructured":"Yan, Y., Mao, Y., Li, B.: Second: sparsely embedded convolutional detection. Sensors 18(10), 3337 (2018)","journal-title":"Sensors"},{"key":"14_CR48","first-page":"1992","volume":"35","author":"Z Yang","year":"2022","unstructured":"Yang, Z., Chen, J., Miao, Z., Li, W., Zhu, X., Zhang, L.: DeepInteraction: 3D object detection via modality interaction. NeurIPS 35, 1992\u20132005 (2022)","journal-title":"NeurIPS"},{"key":"14_CR49","doi-asserted-by":"crossref","unstructured":"Yin, T., Zhou, X., Krahenbuhl, P.: Center-based 3D object detection and tracking. In: CVPR, pp. 11784\u201311793 (2021)","DOI":"10.1109\/CVPR46437.2021.01161"},{"key":"14_CR50","first-page":"16494","volume":"34","author":"T Yin","year":"2021","unstructured":"Yin, T., Zhou, X., Kr\u00e4henb\u00fchl, P.: Multimodal virtual point 3D detection. NeurIPS 34, 16494\u201316507 (2021)","journal-title":"NeurIPS"},{"key":"14_CR51","unstructured":"Zhang, Q., Chen, Y.: Fast sampling of diffusion models with exponential integrator. arXiv preprint arXiv:2204.13902 (2022)"},{"key":"14_CR52","doi-asserted-by":"crossref","unstructured":"Zhou, B., Kr\u00e4henb\u00fchl, P.: Cross-view transformers for real-time map-view semantic segmentation. In: CVPR, pp. 13760\u201313769 (2022)","DOI":"10.1109\/CVPR52688.2022.01339"},{"key":"14_CR53","unstructured":"Zhou, X., et al.: Diffusion-based 3D object detection with random boxes. arXiv preprint arXiv:2309.02049 (2023)"},{"key":"14_CR54","doi-asserted-by":"crossref","unstructured":"Zhou, Y., Tuzel, O.: VoxelNet: end-to-end learning for point cloud based 3D object detection. In: CVPR, pp. 4490\u20134499 (2018)","DOI":"10.1109\/CVPR.2018.00472"},{"key":"14_CR55","doi-asserted-by":"crossref","unstructured":"Zou, J., Zhu, Z., Ye, Y., Wang, X.: DiffBEV: conditional diffusion model for bird\u2019s eye view perception. arXiv preprint arXiv:2303.08333 (2023)","DOI":"10.1609\/aaai.v38i7.28620"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-73113-6_14","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,20]],"date-time":"2024-11-20T10:08:41Z","timestamp":1732097321000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-73113-6_14"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,21]]},"ISBN":["9783031731129","9783031731136"],"references-count":55,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-73113-6_14","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,21]]},"assertion":[{"value":"21 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}