{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,2]],"date-time":"2025-07-02T04:10:47Z","timestamp":1751429447875,"version":"3.41.0"},"reference-count":41,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Supercomput"],"DOI":"10.1007\/s11227-025-07587-y","type":"journal-article","created":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T10:49:24Z","timestamp":1751366964000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Multispectral pedestrian detection model based on cross-attention and self-adapting differential fusion"],"prefix":"10.1007","volume":"81","author":[{"given":"Jinjin","family":"Wang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Meng","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,7,1]]},"reference":[{"issue":"11","key":"7587_CR1","first-page":"3354","volume":"34","author":"A Geiger","year":"2012","unstructured":"Geiger A, Lenz P, Urtasun R (2012) Are we ready for autonomous driving? The Kitti vision benchmark suite. IEEE Trans Pattern Anal Mach Intell 34(11):3354\u20133361","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"7","key":"7587_CR2","doi-asserted-by":"publisher","first-page":"1239","DOI":"10.1109\/TPAMI.2009.122","volume":"32","author":"D Geronimo","year":"2009","unstructured":"Geronimo D, Lopez AM, Sappa AD, Graf T (2009) Survey of pedestrian detection for advanced driver assistance systems. IEEE Trans Pattern Anal Mach Intell 32(7):1239\u20131258","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"2","key":"7587_CR3","doi-asserted-by":"publisher","first-page":"361","DOI":"10.1109\/TPAMI.2013.124","volume":"36","author":"X Wang","year":"2014","unstructured":"Wang X, Wang M, Li W (2014) Scene-specific pedestrian detection for static video surveillance. IEEE Trans Pattern Anal Mach Intell 36(2):361\u2013374","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"7587_CR4","doi-asserted-by":"publisher","first-page":"73","DOI":"10.1016\/j.patcog.2017.01.030","volume":"67","author":"X Li","year":"2017","unstructured":"Li X, Ye M, Liu Y, Zhang F, Liu D, Tang S (2017) Accurate object detection using memory-based models in surveillance scenes. Pattern Recogn 67:73\u201384","journal-title":"Pattern Recogn"},{"key":"7587_CR5","doi-asserted-by":"crossref","unstructured":"Dalal N, Triggs B (2005) Histograms of oriented gradients for human detection. In: 2005 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR\u201905), vol 1. IEEE, pp 886\u2013893","DOI":"10.1109\/CVPR.2005.177"},{"key":"7587_CR6","doi-asserted-by":"crossref","unstructured":"Benenson R, Mathias M, Timofte R, Van\u00a0Gool L (2012) Pedestrian detection at 100 frames per second. In: 2012 IEEE Conference on Computer Vision and Pattern Recognition. IEEE, pp 2903\u20132910","DOI":"10.1109\/CVPR.2012.6248017"},{"key":"7587_CR7","doi-asserted-by":"publisher","first-page":"153","DOI":"10.1016\/j.inffus.2018.02.004","volume":"45","author":"J Ma","year":"2019","unstructured":"Ma J, Ma Y, Li C (2019) Infrared and visible image fusion methods and applications: a survey. Inf Fusion 45:153\u2013178","journal-title":"Inf Fusion"},{"issue":"5","key":"7587_CR8","doi-asserted-by":"publisher","first-page":"2614","DOI":"10.1109\/TIP.2018.2887342","volume":"28","author":"H Li","year":"2018","unstructured":"Li H, Wu X-J (2018) Densefuse: a fusion approach to infrared and visible images. IEEE Trans Image Process 28(5):2614\u20132623","journal-title":"IEEE Trans Image Process"},{"key":"7587_CR9","doi-asserted-by":"publisher","first-page":"15","DOI":"10.1016\/j.inffus.2015.11.003","volume":"30","author":"Z Zhou","year":"2016","unstructured":"Zhou Z, Wang B, Li S, Dong M (2016) Perceptual fusion of infrared and visible images through a hybrid multi-scale decomposition with gaussian and bilateral filters. Inf Fusion 30:15\u201326","journal-title":"Inf Fusion"},{"key":"7587_CR10","doi-asserted-by":"publisher","first-page":"11","DOI":"10.1016\/j.inffus.2018.09.004","volume":"48","author":"J Ma","year":"2019","unstructured":"Ma J, Yu W, Liang P, Li C, Jiang J (2019) Fusiongan: a generative adversarial network for infrared and visible image fusion. Inf Fusion 48:11\u201326","journal-title":"Inf Fusion"},{"key":"7587_CR11","doi-asserted-by":"publisher","first-page":"9","DOI":"10.1016\/j.sigpro.2013.10.010","volume":"97","author":"Y Liu","year":"2014","unstructured":"Liu Y, Jin J, Wang Q, Shen Y, Dong X (2014) Region level based multi-focus image fusion using quaternion wavelet and normalized cut. Signal Process 97:9\u201330","journal-title":"Signal Process"},{"key":"7587_CR12","doi-asserted-by":"publisher","first-page":"11","DOI":"10.1016\/j.infrared.2015.11.003","volume":"74","author":"Q Zhang","year":"2016","unstructured":"Zhang Q, Maldague X (2016) An adaptive fusion approach for infrared and visible images based on NSCT and compressed sensing. Infrared Phys Technol 74:11\u201320","journal-title":"Infrared Phys Technol"},{"issue":"12","key":"7587_CR13","doi-asserted-by":"publisher","first-page":"1882","DOI":"10.1109\/LSP.2016.2618776","volume":"23","author":"Y Liu","year":"2016","unstructured":"Liu Y, Chen X, Ward RK, Wang ZJ (2016) Image fusion with convolutional sparse representation. IEEE Signal Process Lett 23(12):1882\u20131886","journal-title":"IEEE Signal Process Lett"},{"key":"7587_CR14","doi-asserted-by":"publisher","first-page":"640","DOI":"10.1109\/TCI.2020.2965304","volume":"6","author":"R Hou","year":"2020","unstructured":"Hou R, Zhou D, Nie R, Liu D, Xiong L, Guo Y, Yu C (2020) Vif-net: an unsupervised framework for infrared and visible image fusion. IEEE Trans Comput Imaging 6:640\u2013651","journal-title":"IEEE Trans Comput Imaging"},{"key":"7587_CR15","doi-asserted-by":"publisher","first-page":"161","DOI":"10.1016\/j.patcog.2018.08.005","volume":"85","author":"C Li","year":"2019","unstructured":"Li C, Song D, Tong R, Tang M (2019) Illumination-aware faster R-CNN for robust multispectral pedestrian detection. Pattern Recogn 85:161\u2013171","journal-title":"Pattern Recogn"},{"key":"7587_CR16","doi-asserted-by":"publisher","first-page":"148","DOI":"10.1016\/j.inffus.2018.11.017","volume":"50","author":"D Guan","year":"2019","unstructured":"Guan D, Cao Y, Yang J, Cao Y, Yang MY (2019) Fusion of multispectral data through illumination-aware deep neural networks for pedestrian detection. Inf Fusion 50:148\u2013157","journal-title":"Inf Fusion"},{"key":"7587_CR17","doi-asserted-by":"crossref","unstructured":"Zhou K, Chen L, Cao X (2020) Improving multispectral pedestrian detection by addressing modality imbalance problems. In: Computer Vision-ECCV 2020: 16th European Conference, Glasgow, UK, 23\u201328 Aug 2020, Proceedings, Part XVIII 16. Springer, pp 787\u2013803","DOI":"10.1007\/978-3-030-58523-5_46"},{"key":"7587_CR18","doi-asserted-by":"publisher","first-page":"20","DOI":"10.1016\/j.inffus.2018.09.015","volume":"50","author":"L Zhang","year":"2019","unstructured":"Zhang L, Liu Z, Zhang S, Yang X, Qiao H, Huang K, Hussain A (2019) Cross-modality interactive attention network for multispectral pedestrian detection. Inf Fusion 50:20\u201329","journal-title":"Inf Fusion"},{"key":"7587_CR19","doi-asserted-by":"crossref","unstructured":"Zhang H, Fromont E, Lef\u00e8vre S, Avignon B (2021) Guided attentive feature fusion for multispectral pedestrian detection. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp 72\u201380","DOI":"10.1109\/WACV48630.2021.00012"},{"key":"7587_CR20","doi-asserted-by":"crossref","unstructured":"Xing Y, Yang S, Wang S, Zhang S, Liang G, Zhang X, Zhang Y (2024) Ms-detr: multispectral pedestrian detection transformer with loosely coupled fusion and modality-balanced optimization. IEEE Trans Intell Transp Syst","DOI":"10.1109\/TITS.2024.3450584"},{"key":"7587_CR21","doi-asserted-by":"crossref","unstructured":"Kim T, Chung S, Yeom D, Yu Y, Kim HG, Ro YM (2024) Mscotdet: language-driven multi-modal fusion for improved multispectral pedestrian detection. IEEE Trans Circuits Syst Video Technol","DOI":"10.1109\/TCSVT.2024.3524645"},{"key":"7587_CR22","doi-asserted-by":"crossref","unstructured":"Chien C-T, Ju R-Y, Chou K-Y, Lin C-S, Chiang J-S (2024) Yolov8-am: Yolov8 with attention mechanisms for pediatric wrist fracture detection. arXiv preprint arXiv:2402.09329","DOI":"10.1109\/ACCESS.2025.3549839"},{"issue":"1\u20132","key":"7587_CR23","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1561\/0600000095","volume":"14","author":"G Csurka","year":"2022","unstructured":"Csurka G, Volpi R, Chidlovskii B et al (2022) Semantic image segmentation: two decades of research. Found Trends Comput Graph Vis 14(1\u20132):1\u2013162","journal-title":"Found Trends Comput Graph Vis"},{"issue":"1","key":"7587_CR24","doi-asserted-by":"publisher","first-page":"18","DOI":"10.1186\/s40537-023-00693-9","volume":"10","author":"R Sasibhooshan","year":"2023","unstructured":"Sasibhooshan R, Kumaraswamy S, Sasidharan S (2023) Image caption generation using visual attention prediction and contextual spatial relation extraction. J Big Data 10(1):18","journal-title":"J Big Data"},{"key":"7587_CR25","doi-asserted-by":"publisher","first-page":"1178450","DOI":"10.3389\/fcomp.2023.1178450","volume":"5","author":"P Mehrani","year":"2023","unstructured":"Mehrani P, Tsotsos JK (2023) Self-attention in vision transformers performs perceptual grouping, not attention. Front Comput Sci 5:1178450","journal-title":"Front Comput Sci"},{"issue":"9","key":"7587_CR26","doi-asserted-by":"publisher","first-page":"1770","DOI":"10.3390\/electronics13091770","volume":"13","author":"J Guo","year":"2024","unstructured":"Guo J, Huang Z, Tao Y (2024) Multispectral pedestrian detection based on prior-saliency attention and image fusion. Electronics 13(9):1770","journal-title":"Electronics"},{"issue":"6","key":"7587_CR27","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"39","author":"S Ren","year":"2016","unstructured":"Ren S, He K, Girshick R, Sun J (2016) Faster r-cnn: towards real-time object detection with region proposal networks. IEEE Trans Pattern Anal Mach Intell 39(6):1137\u20131149","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"7587_CR28","doi-asserted-by":"publisher","first-page":"154","DOI":"10.1007\/s11263-013-0620-5","volume":"104","author":"JR Uijlings","year":"2013","unstructured":"Uijlings JR, Van De Sande KE, Gevers T, Smeulders AW (2013) Selective search for object recognition. Int J Comput Vis 104:154\u2013171","journal-title":"Int J Comput Vis"},{"key":"7587_CR29","doi-asserted-by":"crossref","unstructured":"Girshick R (2015) Fast R-CNN. In: Proceedings of the IEEE International Conference on Computer Vision, pp 1440\u20131448","DOI":"10.1109\/ICCV.2015.169"},{"key":"7587_CR30","doi-asserted-by":"crossref","unstructured":"Hwang S, Park J, Kim N, Choi Y, So\u00a0Kweon I (2015) Multispectral pedestrian detection: benchmark dataset and baseline. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 1037\u20131045","DOI":"10.1109\/CVPR.2015.7298706"},{"key":"7587_CR31","doi-asserted-by":"crossref","unstructured":"Jia X, Zhu C, Li M, Tang W, Zhou W (2021) Llvip: a visible-infrared paired dataset for low-light vision. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 3496\u20133504","DOI":"10.1109\/ICCVW54120.2021.00389"},{"key":"7587_CR32","doi-asserted-by":"publisher","first-page":"20","DOI":"10.1016\/j.inffus.2018.09.015","volume":"50","author":"L Zhang","year":"2019","unstructured":"Zhang L, Liu Z, Zhang S, Yang X, Qiao H, Huang K, Hussain A (2019) Cross-modality interactive attention network for multispectral pedestrian detection. Inf Fusion 50:20\u201329","journal-title":"Inf Fusion"},{"issue":"4","key":"7587_CR33","doi-asserted-by":"publisher","first-page":"7846","DOI":"10.1109\/LRA.2021.3099870","volume":"6","author":"J Kim","year":"2021","unstructured":"Kim J, Kim H, Kim T, Kim N, Choi Y (2021) MLPD: multi-label pedestrian detector in multispectral domain. IEEE Robot Autom Lett 6(4):7846\u20137853","journal-title":"IEEE Robot Autom Lett"},{"key":"7587_CR34","doi-asserted-by":"crossref","unstructured":"Zhang L, Zhu X, Chen X, Yang X, Lei Z, Liu Z (2019) Weakly aligned cross-modal learning for multispectral pedestrian detection. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 5127\u20135137","DOI":"10.1109\/ICCV.2019.00523"},{"key":"7587_CR35","unstructured":"Li C, Song D, Tong R, Tang M (2018) Multispectral pedestrian detection via simultaneous detection and segmentation. arXiv preprint arXiv:1808.04818"},{"key":"7587_CR36","doi-asserted-by":"crossref","unstructured":"Zhou K, Chen L, Cao X (2020) Improving multispectral pedestrian detection by addressing modality imbalance problems. In: Computer Vision-ECCV 2020: 16th European Conference, Glasgow, UK, 23\u201328 Aug 2020, Proceedings, Part XVIII 16. Springer, pp 787\u2013803","DOI":"10.1007\/978-3-030-58523-5_46"},{"key":"7587_CR37","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.109913","volume":"145","author":"J Shen","year":"2024","unstructured":"Shen J, Chen Y, Liu Y, Zuo X, Fan H, Yang W (2024) ICAFusion: iterative cross-attention guided feature fusion for multispectral object detection. Pattern Recogn 145:109913","journal-title":"Pattern Recogn"},{"key":"7587_CR38","doi-asserted-by":"publisher","DOI":"10.1016\/j.asoc.2023.110768","volume":"147","author":"W Hu","year":"2023","unstructured":"Hu W, Fu C, Cao R, Zang Y, Wu X-J, Shen S, Gao X-Z (2023) Joint dual-stream interaction and multi-scale feature extraction network for multi-spectral pedestrian detection. Appl Soft Comput 147:110768","journal-title":"Appl Soft Comput"},{"key":"7587_CR39","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2022.119047","volume":"214","author":"F Wang","year":"2023","unstructured":"Wang F, Wang R, Sun F (2023) DCMNet: discriminant and cross-modality network for RGB-D salient object detection. Expert Syst Appl 214:119047","journal-title":"Expert Syst Appl"},{"key":"7587_CR40","doi-asserted-by":"crossref","unstructured":"Cao Y, Bin J, Hamari J, Blasch E, Liu Z (2023) Multimodal object detection by channel switching and spatial attention 403\u2013411","DOI":"10.1109\/CVPRW59228.2023.00046"},{"key":"7587_CR41","doi-asserted-by":"crossref","unstructured":"Althoupety A, Wang L-Y, Feng W-C, Rekabdar B (2024) Daff: dual attentive feature fusion for multispectral pedestrian detection 2997\u20133006","DOI":"10.1109\/CVPRW63382.2024.00305"}],"container-title":["The Journal of Supercomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-025-07587-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11227-025-07587-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-025-07587-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T10:49:33Z","timestamp":1751366973000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11227-025-07587-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7,1]]},"references-count":41,"journal-issue":{"issue":"10","published-online":{"date-parts":[[2025,7]]}},"alternative-id":["7587"],"URL":"https:\/\/doi.org\/10.1007\/s11227-025-07587-y","relation":{},"ISSN":["1573-0484"],"issn-type":[{"value":"1573-0484","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,7,1]]},"assertion":[{"value":"15 June 2025","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 July 2025","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"1094"}}