{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,25]],"date-time":"2026-04-25T04:51:11Z","timestamp":1777092671308,"version":"3.51.4"},"reference-count":44,"publisher":"Springer Science and Business Media LLC","issue":"13","license":[{"start":{"date-parts":[[2025,9,10]],"date-time":"2025-09-10T00:00:00Z","timestamp":1757462400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,9,10]],"date-time":"2025-09-10T00:00:00Z","timestamp":1757462400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"Shaanxi Provincal Key Research and Development Program for Future Emerging Industries","award":["2025CY-YBXM-003"],"award-info":[{"award-number":["2025CY-YBXM-003"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62301427"],"award-info":[{"award-number":["62301427"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["SIViP"],"published-print":{"date-parts":[[2025,12]]},"DOI":"10.1007\/s11760-025-04672-w","type":"journal-article","created":{"date-parts":[[2025,9,10]],"date-time":"2025-09-10T11:14:39Z","timestamp":1757502879000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Hierarchical multi-modal feature fusion for RGBT tracking"],"prefix":"10.1007","volume":"19","author":[{"given":"Na","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kai","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zihang","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuquan","family":"Gan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jinglu","family":"He","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,9,10]]},"reference":[{"key":"4672_CR1","doi-asserted-by":"crossref","unstructured":"Li, B., Wu, W., Wang, Q., Zhang, F., Xing, J., Yan, J.: Siamrpn++: Evolution of siamese visual tracking with very deep networks. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4282\u20134291 (2019)","DOI":"10.1109\/CVPR.2019.00441"},{"key":"4672_CR2","doi-asserted-by":"crossref","unstructured":"Li, B., Yan, J., Wu, W., Zhu, Z., Hu, X.: High performance visual tracking with siamese region proposal network. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 8971\u20138980 (2018)","DOI":"10.1109\/CVPR.2018.00935"},{"issue":"7","key":"4672_CR3","first-page":"12549","volume":"34","author":"Y Xu","year":"2020","unstructured":"Xu, Y., Wang, Z., Li, Z., Yuan, Y., Yu, G.: Siamfc++: Towards robust and accurate visual tracking with target estimation guidelines. In: Proceedings of the AAAI Conference on Artificial Intelligence 34(7), 12549\u201312556 (2020)","journal-title":"In: Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"4672_CR4","doi-asserted-by":"crossref","unstructured":"Bhat, G., Danelljan, M., Gool, L.V., Timofte, R.: Learning discriminative model prediction for tracking. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 6182\u20136191 (2019)","DOI":"10.1109\/ICCV.2019.00628"},{"key":"4672_CR5","doi-asserted-by":"crossref","unstructured":"Danelljan, M., Bhat, G., Khan, F.S., Felsberg, M.: Atom: Accurate tracking by overlap maximization. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4660\u20134669 (2019)","DOI":"10.1109\/CVPR.2019.00479"},{"key":"4672_CR6","doi-asserted-by":"crossref","unstructured":"Chen, X., Yan, B., Zhu, J., Wang, D., Yang, X., Lu, H.: Transformer tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 8126\u20138135 (2021)","DOI":"10.1109\/CVPR46437.2021.00803"},{"key":"4672_CR7","first-page":"16743","volume":"35","author":"L Lin","year":"2022","unstructured":"Lin, L., Fan, H., Zhang, Z., Xu, Y., Ling, H.: Swintrack: a simple and strong baseline for transformer tracking. Adv. Neural. Inf. Process. Syst. 35, 16743\u201316754 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"4672_CR8","doi-asserted-by":"publisher","first-page":"326","DOI":"10.1109\/TMM.2023.3264851","volume":"26","author":"J Wang","year":"2023","unstructured":"Wang, J., Yin, P., Wang, Y., Yang, W.: Cmat: integrating convolution mixer and self-attention for visual tracking. IEEE Trans. Multimedia 26, 326\u2013338 (2023)","journal-title":"IEEE Trans. Multimedia"},{"key":"4672_CR9","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2024.106110","volume":"172","author":"J Wang","year":"2024","unstructured":"Wang, J., Lai, C., Wang, Y., Zhang, W.: Emat: efficient feature fusion network for visual tracking via optimized multi-head attention. Neural Netw. 172, 106110 (2024)","journal-title":"Neural Netw."},{"key":"4672_CR10","unstructured":"Long\u00a0Li, C., Lu, A., Hua\u00a0Zheng, A., Tu, Z., Tang, J.: Multi-adapter rgbt tracking. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision Workshops, pp. 0\u20130 (2019)"},{"issue":"17","key":"4672_CR11","doi-asserted-by":"publisher","first-page":"19692","DOI":"10.1109\/JSEN.2023.3295473","volume":"23","author":"M Li","year":"2023","unstructured":"Li, M., Zhang, P., Yan, M., Chen, H., Wu, C.: Dynamic feature-memory transformer network for rgbt tracking. IEEE Sens. J. 23(17), 19692\u201319703 (2023)","journal-title":"IEEE Sens. J."},{"key":"4672_CR12","doi-asserted-by":"crossref","unstructured":"Zhu, J., Lai, S., Chen, X., Wang, D., Lu, H.: Visual prompt multi-modal tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 9516\u20139526 (2023)","DOI":"10.1109\/CVPR52729.2023.00918"},{"key":"4672_CR13","first-page":"927","volume":"38","author":"B Cao","year":"2024","unstructured":"Cao, B., Guo, J., Zhu, P., Hu, Q.: Bi-directional adapter for multimodal tracking. In: Proceedings of the AAAI Conference on Artificial Intelligence 38, 927\u2013935 (2024)","journal-title":"In: Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"4672_CR14","doi-asserted-by":"crossref","unstructured":"Hou, X., Xing, J., Qian, Y., Guo, Y., Xin, S., Chen, J., Tang, K., Wang, M., Jiang, Z., Liu, L., et al.: Sdstrack: Self-distillation symmetric adapter learning for multi-modal visual object tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 26551\u201326561 (2024)","DOI":"10.1109\/CVPR52733.2024.02507"},{"issue":"12","key":"4672_CR15","doi-asserted-by":"publisher","first-page":"14679","DOI":"10.1109\/TITS.2023.3300537","volume":"24","author":"J Zhang","year":"2023","unstructured":"Zhang, J., Liu, H., Yang, K., Hu, X., Liu, R., Stiefelhagen, R.: Cmx: cross-modal fusion for rgb-x semantic segmentation with transformers. IEEE Trans. Intell. Transp. Syst. 24(12), 14679\u201314694 (2023)","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"key":"4672_CR16","doi-asserted-by":"crossref","unstructured":"Reza, M.K., Prater-Bennette, A., Asif, M.S.: Multimodal transformer for material segmentation. arXiv preprint arXiv:2309.04001 (2023)","DOI":"10.1109\/OJSP.2024.3389812"},{"key":"4672_CR17","doi-asserted-by":"publisher","first-page":"3335","DOI":"10.1109\/TIP.2021.3060862","volume":"30","author":"P Zhang","year":"2021","unstructured":"Zhang, P., Zhao, J., Bo, C., Wang, D., Lu, H., Yang, X.: Jointly modeling motion and appearance cues for robust rgb-t tracking. IEEE Trans. Image Process. 30, 3335\u20133347 (2021)","journal-title":"IEEE Trans. Image Process."},{"issue":"3","key":"4672_CR18","doi-asserted-by":"publisher","first-page":"1403","DOI":"10.1109\/TCSVT.2021.3072207","volume":"32","author":"T Zhang","year":"2021","unstructured":"Zhang, T., Liu, X., Zhang, Q., Han, J.: Siamcda: complementarity-and distractor-aware rgb-t tracking based on siamese network. IEEE Trans. Circuits Syst. Video Technol. 32(3), 1403\u20131417 (2021)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"4672_CR19","doi-asserted-by":"publisher","first-page":"14962","DOI":"10.1111\/cgf.14962","volume":"42","author":"T Jin","year":"2023","unstructured":"Jin, T., Lee, S.-H.: Dafnet: generating diverse actions for furniture interaction by learning conditional pose distribution. In Computer Graphics Forum 42, 14962 (2023). (Wiley Online Library)","journal-title":"In Computer Graphics Forum"},{"key":"4672_CR20","doi-asserted-by":"publisher","first-page":"8682","DOI":"10.1609\/aaai.v39i8.32938","volume":"39","author":"Y Xiao","year":"2025","unstructured":"Xiao, Y., Zhao, J., Lu, A., Li, C., Yin, B., Lin, Y., Liu, C.: Cross-modulated attention transformer for rgbt tracking. In Proceedings of the AAAI Conference on Artificial Intelligence 39, 8682\u20138690 (2025)","journal-title":"In Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"4672_CR21","doi-asserted-by":"crossref","unstructured":"Wang, X., Wang, S., Wang, X., Zhao, Z., Zhu, L., Jiang, B., et al.: Mambaevt: Event stream based visual object tracking using state space model. arXiv preprint arXiv:2408.10487 (2024)","DOI":"10.1109\/TCSVT.2025.3588533"},{"key":"4672_CR22","doi-asserted-by":"crossref","unstructured":"Sun, C., Zhang, J., Wang, Y., Ge, H., Xia, Q., Yin, B., Yang, X.: Exploring historical information for rgbe visual tracking with mamba. In: Proceedings of the Computer Vision and Pattern Recognition Conference, pp. 6500\u20136509 (2025)","DOI":"10.1109\/CVPR52734.2025.00609"},{"key":"4672_CR23","doi-asserted-by":"crossref","unstructured":"Ye, B., Chang, H., Ma, B., Shan, S., Chen, X.: Joint feature learning and relation modeling for tracking: A one-stream framework. In: European Conference on Computer Vision, pp. 341\u2013357 (2022). Springer","DOI":"10.1007\/978-3-031-20047-2_20"},{"key":"4672_CR24","doi-asserted-by":"crossref","unstructured":"Wang, X., Wang, S., Wang, X., Zhao, Z., Zhu, L., Jiang, B., et al.: Mambaevt: Event stream based visual object tracking using state space model. arXiv preprint arXiv:2408.10487 (2024)","DOI":"10.1109\/TCSVT.2025.3588533"},{"key":"4672_CR25","doi-asserted-by":"publisher","first-page":"392","DOI":"10.1109\/TIP.2021.3130533","volume":"31","author":"C Li","year":"2021","unstructured":"Li, C., Xue, W., Jia, Y., Qu, Z., Luo, B., Tang, J., Sun, D.: Lasher: a large-scale high-diversity benchmark for rgbt tracking. IEEE Trans. Image Process. 31, 392\u2013404 (2021)","journal-title":"IEEE Trans. Image Process."},{"key":"4672_CR26","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2019.106977","volume":"96","author":"C Li","year":"2019","unstructured":"Li, C., Liang, X., Lu, Y., Zhao, N., Tang, J.: Rgb-t object tracking: benchmark and baseline. Pattern Recogn. 96, 106977 (2019)","journal-title":"Pattern Recogn."},{"key":"4672_CR27","doi-asserted-by":"crossref","unstructured":"Li, C., Zhao, N., Lu, Y., Zhu, C., Tang, J.: Weighted sparse representation regularized graph learning for rgb-t object tracking. In: Proceedings of the 25th ACM International Conference on Multimedia, pp. 1856\u20131864 (2017)","DOI":"10.1145\/3123266.3123289"},{"key":"4672_CR28","doi-asserted-by":"crossref","unstructured":"Zhang, L., Danelljan, M., Gonzalez-Garcia, A., Van De\u00a0Weijer, J., Shahbaz\u00a0Khan, F.: Multi-modal fusion for end-to-end rgb-t tracking. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision Workshops, pp. 0\u20130 (2019)","DOI":"10.1109\/ICCVW.2019.00278"},{"key":"4672_CR29","doi-asserted-by":"crossref","unstructured":"Li, C., Liu, L., Lu, A., Ji, Q., Tang, J.: Challenge-aware rgbt tracking. In: European Conference on Computer Vision, pp. 222\u2013237 (2020). Springer","DOI":"10.1007\/978-3-030-58542-6_14"},{"key":"4672_CR30","doi-asserted-by":"publisher","first-page":"5613","DOI":"10.1109\/TIP.2021.3087341","volume":"30","author":"A Lu","year":"2021","unstructured":"Lu, A., Li, C., Yan, Y., Tang, J., Luo, B.: Rgbt tracking via multi-adapter network with hierarchical divergence loss. IEEE Trans. Image Process. 30, 5613\u20135625 (2021)","journal-title":"IEEE Trans. Image Process."},{"issue":"2","key":"4672_CR31","doi-asserted-by":"publisher","first-page":"393","DOI":"10.3390\/s20020393","volume":"20","author":"H Zhang","year":"2020","unstructured":"Zhang, H., Zhang, L., Zhuo, L., Zhang, J.: Object tracking in rgb-t videos using modal-aware attention network and competitive learning. Sensors 20(2), 393 (2020)","journal-title":"Sensors"},{"issue":"3","key":"4672_CR32","doi-asserted-by":"publisher","first-page":"4118","DOI":"10.1109\/TNNLS.2022.3157594","volume":"36","author":"A Lu","year":"2025","unstructured":"Lu, A., Qian, C., Li, C., Tang, J., Wang, L.: Duality-gated mutual condition network for rgbt tracking. IEEE Transactions on Neural Networks and Learning Systems 36(3), 4118\u20134131 (2025). https:\/\/doi.org\/10.1109\/TNNLS.2022.3157594","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"issue":"5","key":"4672_CR33","doi-asserted-by":"publisher","first-page":"2024","DOI":"10.1007\/s11036-021-01734-4","volume":"26","author":"P Duan","year":"2021","unstructured":"Duan, P., Li, H., Zhang, B., Cao, Y., Wang, E.: Apfnet: amplitude-phase fusion network for csi-based action recognition. Mobile Networks and Applications 26(5), 2024\u20132034 (2021)","journal-title":"Mobile Networks and Applications"},{"key":"4672_CR34","doi-asserted-by":"crossref","unstructured":"Yang, J., Li, Z., Zheng, F., Leonardis, A., Song, J.: Prompting for multi-modal tracking. In: Proceedings of the 30th ACM International Conference on Multimedia, pp. 3492\u20133500 (2022)","DOI":"10.1145\/3503161.3547851"},{"issue":"14","key":"4672_CR35","doi-asserted-by":"publisher","first-page":"6609","DOI":"10.3390\/s23146609","volume":"23","author":"Y Luo","year":"2023","unstructured":"Luo, Y., Guo, X., Dong, M., Yu, J.: Learning modality complementary features with mixed attention mechanism for rgb-t tracking. Sensors 23(14), 6609 (2023)","journal-title":"Sensors"},{"key":"4672_CR36","doi-asserted-by":"crossref","unstructured":"Wu, Z., Zheng, J., Ren, X., Vasluianu, F.-A., Ma, C., Paudel, D.P., Van\u00a0Gool, L., Timofte, R.: Single-model and any-modality for video object tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 19156\u201319166 (2024)","DOI":"10.1109\/CVPR52733.2024.01812"},{"key":"4672_CR37","doi-asserted-by":"crossref","unstructured":"Sun, D., Pan, Y., Lu, A., Li, C., Luo, B.: Transformer rgbt tracking with spatio-temporal multimodal tokens. arXiv preprint arXiv:2401.01674 (2024)","DOI":"10.1109\/TCSVT.2024.3425455"},{"key":"4672_CR38","doi-asserted-by":"crossref","unstructured":"Hui, T., Xun, Z., Peng, F., Huang, J., Wei, X., Wei, X., Dai, J., Han, J., Liu, S.: Bridging search region interaction with template for rgb-t tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 13630\u201313639 (2023)","DOI":"10.1109\/CVPR52729.2023.01310"},{"key":"4672_CR39","doi-asserted-by":"crossref","unstructured":"Shi, H., Mu, X., Shen, D., Zhong, C.: Learning a multimodal feature transformer for rgbt tracking. Signal, Image and Video Processing, 1\u201312 (2024)","DOI":"10.1007\/s11760-024-03148-7"},{"key":"4672_CR40","doi-asserted-by":"crossref","unstructured":"Lu, A., Wang, W., Li, C., Tang, J., Luo, B.: After: Attention-based fusion router for rgbt tracking. arXiv preprint arXiv:2405.02717 (2024)","DOI":"10.1109\/TIP.2025.3586467"},{"issue":"2","key":"4672_CR41","doi-asserted-by":"publisher","first-page":"579","DOI":"10.1109\/TCSVT.2021.3067997","volume":"32","author":"Y Zhu","year":"2021","unstructured":"Zhu, Y., Li, C., Tang, J., Luo, B., Wang, L.: Rgbt tracking by trident fusion network. IEEE Trans. Circuits Syst. Video Technol. 32(2), 579\u2013592 (2021)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"4672_CR42","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2022.104547","volume":"127","author":"Q Zhang","year":"2022","unstructured":"Zhang, Q., Liu, X., Zhang, T.: Rgb-t tracking by modality difference reduction and feature re-selection. Image Vis. Comput. 127, 104547 (2022)","journal-title":"Image Vis. Comput."},{"key":"4672_CR43","doi-asserted-by":"crossref","unstructured":"Zhang, T., Guo, H., Jiao, Q., Zhang, Q., Han, J.: Efficient rgb-t tracking via cross-modality distillation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5404\u20135413 (2023)","DOI":"10.1109\/CVPR52729.2023.00523"},{"key":"4672_CR44","doi-asserted-by":"publisher","first-page":"1753","DOI":"10.1109\/TIP.2024.3371355","volume":"33","author":"L Liu","year":"2024","unstructured":"Liu, L., Li, C., Xiao, Y., Ruan, R., Fan, M.: Rgbt tracking via challenge-based appearance disentanglement and interaction. IEEE Trans. Image Process. 33, 1753\u20131767 (2024). https:\/\/doi.org\/10.1109\/TIP.2024.3371355","journal-title":"IEEE Trans. Image Process."}],"container-title":["Signal, Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-025-04672-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11760-025-04672-w\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-025-04672-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,9]],"date-time":"2025-10-09T03:27:27Z","timestamp":1759980447000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11760-025-04672-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,10]]},"references-count":44,"journal-issue":{"issue":"13","published-print":{"date-parts":[[2025,12]]}},"alternative-id":["4672"],"URL":"https:\/\/doi.org\/10.1007\/s11760-025-04672-w","relation":{},"ISSN":["1863-1703","1863-1711"],"issn-type":[{"value":"1863-1703","type":"print"},{"value":"1863-1711","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,9,10]]},"assertion":[{"value":"26 May 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 July 2025","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 August 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 September 2025","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}},{"value":"Not applicable.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical approval"}}],"article-number":"1075"}}