{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T23:13:23Z","timestamp":1780355603713,"version":"3.54.1"},"reference-count":36,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2025,1,13]],"date-time":"2025-01-13T00:00:00Z","timestamp":1736726400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,13]],"date-time":"2025-01-13T00:00:00Z","timestamp":1736726400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"Major Science and Technology Special Project of Nanjing","award":["202209008"],"award-info":[{"award-number":["202209008"]}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["NI2023002"],"award-info":[{"award-number":["NI2023002"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Postgraduate Research & Practice Innovation Program of Jiangsu Province","award":["KYCX22_0338"],"award-info":[{"award-number":["KYCX22_0338"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2025,4]]},"DOI":"10.1007\/s10489-024-06192-5","type":"journal-article","created":{"date-parts":[[2025,1,13]],"date-time":"2025-01-13T03:52:29Z","timestamp":1736740349000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["DGT: Depth-guided RGB-D occluded target detection with transformers"],"prefix":"10.1007","volume":"55","author":[{"given":"Kelei","family":"Xu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chunyan","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wanzhong","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jinqiang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,1,13]]},"reference":[{"key":"6192_CR1","doi-asserted-by":"publisher","DOI":"10.1088\/1757-899x\/1145\/1\/012043","author":"A Karmakar","year":"2021","unstructured":"Karmakar A, Aju D (2021) Detection of partially occluded objects \u2013 A comparative analysis based on Haar Classifier and K-Means Clustering. IOP Conf Ser: Mater Sci Eng. https:\/\/doi.org\/10.1088\/1757-899x\/1145\/1\/012043","journal-title":"IOP Conf Ser: Mater Sci Eng"},{"key":"6192_CR2","unstructured":"Xu Q, Zhong Y, Neumann U (2021) Behind the Curtain: Learning Occluded Shapes for 3D Object Detection. In Computer Vision and Pattern Recognition arxiv-2112.02205"},{"key":"6192_CR3","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TIM.2021.3102739","volume":"70","author":"X Xu","year":"2021","unstructured":"Xu X, Zhang L, Yang J, Cao C, Tan Z, Luo M (2021) Object detection based on fusion of sparse point cloud and image information. IEEE Trans Instrum Meas 70:1\u201312. https:\/\/doi.org\/10.1109\/TIM.2021.3102739. Art no. 2512412","journal-title":"IEEE Trans Instrum Meas"},{"key":"6192_CR4","doi-asserted-by":"publisher","unstructured":"Ke L, Tai Y\u2013W, Tang C-K (2021) Deep occlusion-aware instance segmentation with overlapping bilayers. 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Nashville, TN, USA, pp. 4018\u20134027. https:\/\/doi.org\/10.1109\/CVPR46437.2021.00401","DOI":"10.1109\/CVPR46437.2021.00401"},{"key":"6192_CR5","doi-asserted-by":"publisher","unstructured":"Pu M, Huang Y, Liu Y, Guan Q, Ling H (2022) EDTER: Edge detection with transformer. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), New Orleans, LA, USA, pp. 1392\u20131402. https:\/\/doi.org\/10.1109\/CVPR52688.2022.00146","DOI":"10.1109\/CVPR52688.2022.00146"},{"key":"6192_CR6","doi-asserted-by":"publisher","unstructured":"Li Y, Yu AW, Meng T, Caine B, Ngiam J, Peng D, Shen J, Lu Y, Zhou D, Le QV, Yuille A, Tan M (2022) DeepFusion: Lidar-camera deep fusion for multi-modal 3D object detection. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), New Orleans, LA, USA, pp. 17161\u201317170. https:\/\/doi.org\/10.1109\/CVPR52688.2022.01667","DOI":"10.1109\/CVPR52688.2022.01667"},{"key":"6192_CR7","doi-asserted-by":"publisher","unstructured":"Bai X, Hu Z, Zhu X, Huang Q, Chen Y, Fu H, Tai C-L (2022) TransFusion: Robust lidar-camera fusion for 3D object detection with transformers. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), New Orleans, LA, USA, pp. 1080\u20131089. https:\/\/doi.org\/10.1109\/CVPR52688.2022.00116","DOI":"10.1109\/CVPR52688.2022.00116"},{"key":"6192_CR8","doi-asserted-by":"publisher","unstructured":"Lin W, Zheng C, Yong J-H, Xu F (2022) OcclusionFusion: Occlusion-aware motion estimation for real-time dynamic 3D reconstruction. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), New Orleans, LA, USA, pp. 1726\u20131735. https:\/\/doi.org\/10.1109\/CVPR52688.2022.00178","DOI":"10.1109\/CVPR52688.2022.00178"},{"issue":"12","key":"6192_CR9","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/LSENS.2020.3041585","volume":"4","author":"A Raza","year":"2020","unstructured":"Raza A, Huo H, Fang T (2020) PFAF-Net: Pyramid feature network for multimodal fusion. IEEE Sensors Lett 4(12):1\u20134. https:\/\/doi.org\/10.1109\/LSENS.2020.3041585. Art no. 5501704","journal-title":"IEEE Sensors Lett"},{"key":"6192_CR10","doi-asserted-by":"publisher","unstructured":"Vs V, Jose Valanarasu JM, Oza P, Patel VM (2022) Image Fusion Transformer. 2022 IEEE International Conference on Image Processing (ICIP), Bordeaux, France, pp. 3566\u20133570. https:\/\/doi.org\/10.1109\/ICIP46576.2022.9897280","DOI":"10.1109\/ICIP46576.2022.9897280"},{"key":"6192_CR11","doi-asserted-by":"publisher","unstructured":"Zhao H, Nie R (2021) DNDT: Infrared and visible image fusion via densenet and dual-transformer. 2021 International Conference on Information Technology and Biomedical Engineering (ICITBE), Nanchang, China, pp. 71\u201375. https:\/\/doi.org\/10.1109\/ICITBE54178.2021.00025","DOI":"10.1109\/ICITBE54178.2021.00025"},{"key":"6192_CR12","doi-asserted-by":"publisher","unstructured":"Xia Y, Gu C, Wu K (2022) Multi-type and multi-level feature fusion network for RGBD indoor semantic segmentation. 2022 34th Chinese Control and Decision Conference (CCDC), Hefei, China, pp. 6142-6148. https:\/\/doi.org\/10.1109\/CCDC55256.2022.10033547","DOI":"10.1109\/CCDC55256.2022.10033547"},{"key":"6192_CR13","doi-asserted-by":"publisher","first-page":"26602","DOI":"10.1109\/ACCESS.2020.2971509","volume":"8","author":"F Xiao","year":"2020","unstructured":"Xiao F, Li B, Peng Y, Cao C, Hu K, Gao X (2020) Multi-modal weights sharing and hierarchical feature fusion for RGBD salient object detection. IEEE Access 8:26602\u201326611. https:\/\/doi.org\/10.1109\/ACCESS.2020.2971509","journal-title":"IEEE Access"},{"key":"6192_CR14","doi-asserted-by":"publisher","first-page":"120781","DOI":"10.1109\/ACCESS.2022.3214316","volume":"10","author":"D Nazir","year":"2022","unstructured":"Nazir D, Pagani A, Liwicki M, Stricker D, Afzal MZ (2022) SemAttNet: Toward attention-based semantic aware guided depth completion. IEEE Access 10:120781\u2013120791. https:\/\/doi.org\/10.1109\/ACCESS.2022.3214316","journal-title":"IEEE Access"},{"key":"6192_CR15","doi-asserted-by":"publisher","DOI":"10.1007\/s00521-022-07259-5","author":"AV Konstantinov","year":"2022","unstructured":"Konstantinov AV, Utkin LV (2022) Multi-attention multiple instance learning. Neural Comput Appl. https:\/\/doi.org\/10.1007\/s00521-022-07259-5","journal-title":"Neural Comput Appl"},{"key":"6192_CR16","doi-asserted-by":"publisher","DOI":"10.1088\/1361-6501\/acef47","author":"G Xu","year":"2023","unstructured":"Xu G, Cao X, Liu J, Fan J, Li E, Long X (2023) Robust and accurate depth estimation by fusing LiDAR and stereo. Meas Sci Technol. https:\/\/doi.org\/10.1088\/1361-6501\/acef47","journal-title":"Meas Sci Technol"},{"key":"6192_CR17","doi-asserted-by":"publisher","DOI":"10.1038\/s41598-022-24836-9","author":"S Jiang","year":"2022","unstructured":"Jiang S, Xu Y, Li D, Fan R (2022) Multi-scale fusion for RGB-D indoor semantic segmentation. Sci Rep. https:\/\/doi.org\/10.1038\/s41598-022-24836-9","journal-title":"Sci Rep"},{"key":"6192_CR18","doi-asserted-by":"publisher","DOI":"10.1007\/s11760-023-02502-5","author":"AT Candan","year":"2023","unstructured":"Candan AT, Kalkan H (2023) U-Net-based RGB and LiDAR image fusion for road segmentation. Signal Image Video Process. https:\/\/doi.org\/10.1007\/s11760-023-02502-5","journal-title":"Signal Image Video Process"},{"key":"6192_CR19","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2021.08.028","author":"R Guo","year":"2021","unstructured":"Guo R, Li D, Han Y (2021) Deep multi-scale and multi-modal fusion for 3D object detection. Pattern Recogn Lett. https:\/\/doi.org\/10.1016\/j.patrec.2021.08.028","journal-title":"Pattern Recogn Lett"},{"key":"6192_CR20","doi-asserted-by":"publisher","first-page":"5121","DOI":"10.1109\/TIP.2022.3193223","volume":"31","author":"L Yang","year":"2022","unstructured":"Yang L, Xu Y, Wang S, Yuan C, Zhang Z, Li B, Hu W (2022) PDNet: Toward better one-stage object detection with prediction decoupling. IEEE Trans Image Process 31:5121\u20135133. https:\/\/doi.org\/10.1109\/TIP.2022.3193223","journal-title":"IEEE Trans Image Process"},{"key":"6192_CR21","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TIM.2022.3196130","volume":"71","author":"H Tian","year":"2022","unstructured":"Tian H, Song K, Li S, Ma S, Yan Y (2022) Lightweight pixel-wise generative robot grasping detection based on RGB-D dense fusion. IEEE Trans Instrum Meas 71:1\u201312. https:\/\/doi.org\/10.1109\/TIM.2022.3196130. Art no. 5017912","journal-title":"IEEE Trans Instrum Meas"},{"key":"6192_CR22","unstructured":"Dosovitskiy A, Beyer L, Kolesnikov A, Weissenborn D, Zhai X, Un-terthiner T, Dehghani M, Minderer M, Heigold G, Gelly S, Uszkoreit J, Houlsby N (2021) An image is worth 16x16 words: Transformers for image recognition at scale. http:\/\/arxiv.org\/abs\/2010.11929 (accessed June 11, 2022)"},{"key":"6192_CR23","doi-asserted-by":"publisher","unstructured":"Yuan L, Chen Y, Wang T, Yu W, Shi Y, Jiang Z, EH Tay F, Feng J, Yan S (2021) Tokens-to-token ViT: Training vision transformers from scratch on ImageNet. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV), Montreal, QC, Canada, pp. 538\u2013547. https:\/\/doi.org\/10.1109\/ICCV48922.2021.00060","DOI":"10.1109\/ICCV48922.2021.00060"},{"key":"6192_CR24","doi-asserted-by":"crossref","unstructured":"Carion N, Massa F, Synnaeve G, Usunier N, Kirillov A, Zagoruyko S (2020) End-to-end object detection with transformers. http:\/\/arxiv.org\/abs\/2020.12872 (accessed June 11, 2022)","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"6192_CR25","doi-asserted-by":"publisher","DOI":"10.1016\/j.compeleceng.2022.108451","author":"Y Li","year":"2022","unstructured":"Li Y, Cai J (2022) Point cloud classification network based on self-attention mechanism. Comput Electr Eng. https:\/\/doi.org\/10.1016\/j.compeleceng.2022.108451","journal-title":"Comput Electr Eng"},{"key":"6192_CR26","doi-asserted-by":"publisher","first-page":"107766","DOI":"10.1016\/j.sigpro.2020.107766","volume":"178","author":"J Wu","year":"2021","unstructured":"Wu J, Zhou W, Luo T, Yu L, Lei J (2021) Multiscale multilevel context and multimodal fusion for RGB-D salient object detection. Signal Process 178:107766","journal-title":"Signal Process"},{"key":"6192_CR27","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2020.107630","author":"F Liang","year":"2021","unstructured":"Liang F, Duan L, Ma W, Qiao Y, Miao J, Ye Q (2021) Context-aware network for RGB-D salient object detection. Pattern Recog. https:\/\/doi.org\/10.1016\/j.patcog.2020.107630","journal-title":"Pattern Recog"},{"issue":"6","key":"6192_CR28","doi-asserted-by":"publisher","first-page":"3641","DOI":"10.1109\/TSMC.2019.2957386","volume":"51","author":"W Zhou","year":"2020","unstructured":"Zhou W, Lv Y, Lei J, Yu L (2020) Global and local-contrast guides content-aware fusion for RGB-D saliency prediction. IEEE Trans Syst Man Cybern: Syst 51(6):3641\u20133649. https:\/\/doi.org\/10.1109\/TSMC.2019.2957386","journal-title":"IEEE Trans Syst Man Cybern: Syst"},{"key":"6192_CR29","doi-asserted-by":"publisher","DOI":"10.1109\/tcsvt.2022.3193612","author":"M Zhang","year":"2022","unstructured":"Zhang M, Shi M, Li L (2022) MFNet: Multiclass few-shot segmentation network with pixel-wise metric learning. IEEE Trans Circ Syst Video Technol. https:\/\/doi.org\/10.1109\/tcsvt.2022.3193612","journal-title":"IEEE Trans Circ Syst Video Technol"},{"key":"6192_CR30","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2023.3300537","author":"J Zhang","year":"2023","unstructured":"Zhang J, Liu H, Yang K, Hu X, Liu R, Stiefelhagen R (2023) CMX: Cross-modal fusion for RGB-X semantic segmentation with transformers. IEEE Trans Intell Transp Syst. https:\/\/doi.org\/10.1109\/TITS.2023.3300537","journal-title":"IEEE Trans Intell Transp Syst"},{"key":"6192_CR31","doi-asserted-by":"publisher","first-page":"42012","DOI":"10.1109\/ACCESS.2023.3270911","volume":"11","author":"Z Tang","year":"2023","unstructured":"Tang Z, Zhang Z, Chen W, Yang W (2023) An SIFT-based fast image alignment algorithm for high-resolution image. IEEE Access 11:42012\u201342041. https:\/\/doi.org\/10.1109\/ACCESS.2023.3270911","journal-title":"IEEE Access"},{"key":"6192_CR32","doi-asserted-by":"publisher","unstructured":"Xu X, Zhang Z, Qiu C, Liu Z (2022) Feature matching and object registration based on convex hull alignment. 2022 3rd International Conference on Computer Vision, Image and Deep Learning & International Conference on Computer Engineering and Applications (CVIDL & ICCEA), Changchun, China, pp. 407\u2013411. https:\/\/doi.org\/10.1109\/CVIDLICCEA56201.2022.9825155","DOI":"10.1109\/CVIDLICCEA56201.2022.9825155"},{"key":"6192_CR33","doi-asserted-by":"publisher","DOI":"10.1155\/2021\/5555121","author":"H Nguyen","year":"2021","unstructured":"Nguyen H (2021) Multiscale feature learning based on enhanced feature pyramid for vehicle detection. Complexity. https:\/\/doi.org\/10.1155\/2021\/5555121","journal-title":"Complexity"},{"key":"6192_CR34","doi-asserted-by":"publisher","unstructured":"Geiger A, Lenz P, Urtasun R (2012) Are we ready for autonomous driving? The KITTI vision benchmark suite. 2012 IEEE Conference on Computer Vision and Pattern Recognition, Providence, RI, USA, pp. 3354\u20133361, https:\/\/doi.org\/10.1109\/CVPR.2012.6248074","DOI":"10.1109\/CVPR.2012.6248074"},{"key":"6192_CR35","doi-asserted-by":"publisher","unstructured":"Huang X, Wang P, Cheng X (2018) The ApolloScape Open Dataset for Autonomous Driving and its Application. 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW).IEEE, https:\/\/doi.org\/10.1109\/CVPRW.2018.00141","DOI":"10.1109\/CVPRW.2018.00141"},{"key":"6192_CR36","doi-asserted-by":"publisher","unstructured":"Rodrigues JSM, N\u00fcchter A (2020) Analytical Change Detection on the KITTI dataset. 2020 16th International Conference on Control, Automation, Robotics and Vision (ICARCV), Shenzhen, China, pp. 892\u2013897, https:\/\/doi.org\/10.1109\/ICARCV50220.2020.9305309","DOI":"10.1109\/ICARCV50220.2020.9305309"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-024-06192-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-024-06192-5\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-024-06192-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,22]],"date-time":"2025-02-22T17:20:51Z","timestamp":1740244851000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-024-06192-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,1,13]]},"references-count":36,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2025,4]]}},"alternative-id":["6192"],"URL":"https:\/\/doi.org\/10.1007\/s10489-024-06192-5","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"value":"0924-669X","type":"print"},{"value":"1573-7497","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,1,13]]},"assertion":[{"value":"11 December 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 January 2025","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"Informed consent for publication of this paper and data usage was obtained from the Nanjing University of Aeronautics and Astronautics and all authors.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical and informed consent for data used"}},{"value":"The authors declare that no potential conflicts of interest with respect to the research, authorship, and\/or publication of this article.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"300"}}