{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T19:12:34Z","timestamp":1778872354888,"version":"3.51.4"},"reference-count":25,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T00:00:00Z","timestamp":1777334400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T00:00:00Z","timestamp":1777334400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100004479","name":"Jiangxi Provincial Natural Science Foundation","doi-asserted-by":"crossref","award":["20242BAB25075"],"award-info":[{"award-number":["20242BAB25075"]}],"id":[{"id":"10.13039\/501100004479","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["SIViP"],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1007\/s11760-026-05351-0","type":"journal-article","created":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T19:23:21Z","timestamp":1777404201000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Learning Global Perception and Cross-Scale Dependencies for Visual Tracking"],"prefix":"10.1007","volume":"20","author":[{"given":"Wenshuang","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lu","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jun","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,4,28]]},"reference":[{"key":"5351_CR1","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2024.111278","volume":"161","author":"X Yang","year":"2025","unstructured":"Yang, X., Zeng, D., Wang, X., Wu, Y., Ye, H., Zhao, Q., Li, S.: Adaptively bypassing vision transformer blocks for efficient visual tracking. Pattern Recogn. 161, 111278 (2025)","journal-title":"Pattern Recogn."},{"issue":"2","key":"5351_CR2","doi-asserted-by":"publisher","first-page":"1655","DOI":"10.1109\/TCSVT.2025.3601598","volume":"36","author":"Y Xue","year":"2026","unstructured":"Xue, Y., Jin, G., Zhong, B., Shen, T., Tan, L., Xue, C., Zheng, Y.: Fmtrack: frequency-aware interaction and multi-expert fusion for rgb-t tracking. IEEE Trans. Circuits Syst. Video Technol. 36(2), 1655\u20131667 (2026). https:\/\/doi.org\/10.1109\/TCSVT.2025.3601598","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"5351_CR3","doi-asserted-by":"crossref","unstructured":"Wang, Y., Zhou, L., An, Z., Sun, L., Hu, M., Wang, J.: Global-local dual-branch network with local feature enhancement for visual tracking, J. Vis. Commun. Image Represent. 104725 (2026)","DOI":"10.1016\/j.jvcir.2026.104725"},{"key":"5351_CR4","doi-asserted-by":"crossref","unstructured":"Li, B., Wu, W., Wang, Q., Zhang, F., Xing, J., Yan, J.: Siamrpn++: Evolution of siamese visual tracking with very deep networks, In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4282\u20134291 (2019)","DOI":"10.1109\/CVPR.2019.00441"},{"key":"5351_CR5","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2024.106110","volume":"172","author":"J Wang","year":"2024","unstructured":"Wang, J., Lai, C., Wang, Y., Zhang, W.: Emat: efficient feature fusion network for visual tracking via optimized multi-head attention. Neural Netw. 172, 106110 (2024)","journal-title":"Neural Netw."},{"key":"5351_CR6","doi-asserted-by":"crossref","unstructured":"Zhu, J., Chen, X., Diao, H., Li, S., He, J-Y., Li, C., Luo, B., Wang, D., Lu, H.: Exploring dynamic transformer for efficient object tracking, IEEE Trans. Neural Netw. Learn. Syst (2025)","DOI":"10.1109\/TNNLS.2025.3545752"},{"key":"5351_CR7","doi-asserted-by":"crossref","unstructured":"Zhu, J., Tang, H., Chen, X., Wang, X., Wang, D., xLu, D.: Two-stream beats one-stream: asymmetric siamese network for efficient visual tracking, In: Proceedings of the AAAI Conference on Artificial Intelligence, Vol.\u00a039, pp. 10959\u201310967 (2025)","DOI":"10.1609\/aaai.v39i10.33191"},{"key":"5351_CR8","doi-asserted-by":"crossref","unstructured":"Zaveri, R.J., Patel, S., Gu, Y., Doretto, G.: Improving accuracy and generalization for efficient visual tracking, In: 2025 IEEE Winter Conference on Applications of Computer Vision, IEEE, pp. 9468\u20139478 (2025)","DOI":"10.1109\/WACV61041.2025.00917"},{"issue":"3","key":"5351_CR9","doi-asserted-by":"publisher","first-page":"3617","DOI":"10.1007\/s40747-024-01345-y","volume":"10","author":"J Wang","year":"2024","unstructured":"Wang, J., Yin, P., Yang, W., Wang, Y., Wang, S.: Exploiting multi-scale hierarchical feature representation for visual tracking. Complex Intell. Syst. 10(3), 3617\u20133632 (2024)","journal-title":"Complex Intell. Syst."},{"key":"5351_CR10","doi-asserted-by":"publisher","first-page":"326","DOI":"10.1109\/TMM.2023.3264851","volume":"26","author":"J Wang","year":"2023","unstructured":"Wang, J., Yin, P., Wang, Y., Yang, W.: Cmat: integrating convolution mixer and self-attention for visual tracking. IEEE Trans. Multimedia 26, 326\u2013338 (2023)","journal-title":"IEEE Trans. Multimedia"},{"key":"5351_CR11","doi-asserted-by":"crossref","unstructured":"Kang, B., Chen, X., Wang, D., Peng, H., Lu, H.: Exploring lightweight hierarchical vision transformers for efficient visual tracking, In: Proceedings of the IEEE international conference on computer vision, pp. 9612\u20139621 (2023)","DOI":"10.1109\/ICCV51070.2023.00881"},{"key":"5351_CR12","doi-asserted-by":"crossref","unstructured":"Blatter, P., Kanakis, M., Danelljan, M., Van Gool, L.: Efficient visual tracking with exemplar transformers, In: Proceedings of the IEEE Winter conference on applications of computer vision, pp. 1571\u20131581 (2023)","DOI":"10.1109\/WACV56688.2023.00162"},{"issue":"5","key":"5351_CR13","doi-asserted-by":"publisher","first-page":"5793","DOI":"10.1007\/s40747-023-01043-1","volume":"9","author":"J Wang","year":"2023","unstructured":"Wang, J., Lai, C., Zhang, W., Wang, Y., Meng, C.: Transformer tracking with multi-scale dual-attention. Complex Intell. Syst. 9(5), 5793\u20135806 (2023)","journal-title":"Complex Intell. Syst."},{"key":"5351_CR14","unstructured":"Zhu, J., Chen, X., Wang, D., Zhao, W., Lu, H.: Srrt: search region regulation tracking, arXiv preprint arXiv:2207.04438 (2022)"},{"key":"5351_CR15","doi-asserted-by":"crossref","unstructured":"Tang, F., Ling, Q.: Ranking-based siamese visual tracking, In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 8741\u20138750 (2022)","DOI":"10.1109\/CVPR52688.2022.00854"},{"key":"5351_CR16","doi-asserted-by":"crossref","unstructured":"Guo, M., Zhang, Z., Fan, H., Jing, L., Lyu, Y., Li, B., Hu, W.: Learning target-aware representation for visual tracking via informative interactions, In: arXiv preprint arXiv:2201.02526, (2022)","DOI":"10.24963\/ijcai.2022\/130"},{"key":"5351_CR17","doi-asserted-by":"crossref","unstructured":"Fu, Z., Fu, Z., Liu, Q., Cai, W., Wang, Y.: Sparsett: visual tracking with sparse transformers, arXiv preprint arXiv:2205.03776 (2022)","DOI":"10.24963\/ijcai.2022\/127"},{"key":"5351_CR18","doi-asserted-by":"crossref","unstructured":"Shen, Q., Qiao, L., Guo, J., Li, P., Li, X., Li, B., Feng, W., Gan, W., Wu, W., Ouyang, W.: Unsupervised learning of accurate siamese tracking, In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 8101\u20138110 (2022)","DOI":"10.1109\/CVPR52688.2022.00793"},{"key":"5351_CR19","doi-asserted-by":"crossref","unstructured":"Bhat, G., Danelljan, M., Gool, L.V., Timofte, R.: Learning discriminative model prediction for tracking, In: Proceedings of the IEEE International Conference on Computer Vision, pp. 6182\u20136191 (2019)","DOI":"10.1109\/ICCV.2019.00628"},{"key":"5351_CR20","doi-asserted-by":"crossref","unstructured":"Wang, N., Zhou, W., Wang, J., Li, H.: Transformer meets tracker: exploiting temporal context for robust visual tracking, In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1571\u20131580 (2021)","DOI":"10.1109\/CVPR46437.2021.00162"},{"key":"5351_CR21","doi-asserted-by":"crossref","unstructured":"Mayer, C., Danelljan, M., Bhat, G., Paul, M., Paudel, D.P., Yu, F., Van Gool, L.: Transforming model prediction for tracking, In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 8731\u20138740 ((2022)","DOI":"10.1109\/CVPR52688.2022.00853"},{"key":"5351_CR22","unstructured":"Shen, Q., Li, X., Meng, F., Liang, Y.: Context-aware visual tracking with joint meta-updating, arXiv preprint arXiv:2204.01513 (2022)"},{"key":"5351_CR23","doi-asserted-by":"crossref","unstructured":"Yan, B., Peng, H., Fu, J., Wang, D., Lu, H.: Learning spatio-temporal transformer for visual tracking, In: Proceedings of the IEEE International Conference on Computer Vision, pp. 10448\u201310457 (2021)","DOI":"10.1109\/ICCV48922.2021.01028"},{"key":"5351_CR24","doi-asserted-by":"crossref","unstructured":"Ye, B., Chang, H., Ma, B., Shan, S., Chen, X.: Joint feature learning and relation modeling for tracking: a one-stream framework, In: European conference on computer vision, Springer, pp. 341\u2013357 (2022)","DOI":"10.1007\/978-3-031-20047-2_20"},{"key":"5351_CR25","doi-asserted-by":"crossref","unstructured":"Xie, F., Yang, W., Wang, C., Chu, L., Cao, Y., Ma, C., Zeng, W.: Correlation-embedded transformer tracking: a single-branch framework, IEEE Transactions on Pattern Analysis and Machine Intelligence (2024)","DOI":"10.1109\/TPAMI.2024.3448254"}],"container-title":["Signal, Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-026-05351-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11760-026-05351-0","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-026-05351-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T18:39:48Z","timestamp":1778870388000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11760-026-05351-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,28]]},"references-count":25,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2026,5]]}},"alternative-id":["5351"],"URL":"https:\/\/doi.org\/10.1007\/s11760-026-05351-0","relation":{},"ISSN":["1863-1703","1863-1711"],"issn-type":[{"value":"1863-1703","type":"print"},{"value":"1863-1711","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,4,28]]},"assertion":[{"value":"9 December 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 March 2026","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 April 2026","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 April 2026","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"301"}}