{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T00:58:31Z","timestamp":1781225911402,"version":"3.54.1"},"reference-count":68,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62402449"],"award-info":[{"award-number":["62402449"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62272419"],"award-info":[{"award-number":["62272419"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004731","name":"Zhejiang Province Natural Science Foundation","doi-asserted-by":"publisher","award":["LD26F020003"],"award-info":[{"award-number":["LD26F020003"]}],"id":[{"id":"10.13039\/501100004731","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004731","name":"Zhejiang Province Natural Science Foundation","doi-asserted-by":"publisher","award":["LQ23F020010"],"award-info":[{"award-number":["LQ23F020010"]}],"id":[{"id":"10.13039\/501100004731","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004835","name":"Zhejiang University","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004835","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100011442","name":"State Key Laboratory of CAD and CG","doi-asserted-by":"publisher","award":["A2421"],"award-info":[{"award-number":["A2421"]}],"id":[{"id":"10.13039\/501100011442","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Knowledge-Based Systems"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1016\/j.knosys.2026.116030","type":"journal-article","created":{"date-parts":[[2026,4,17]],"date-time":"2026-04-17T16:31:44Z","timestamp":1776443504000},"page":"116030","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Template-Free Tracking Guidance for transformer trackers"],"prefix":"10.1016","volume":"343","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-6439-9845","authenticated-orcid":false,"given":"Xuan","family":"Wang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5787-2705","authenticated-orcid":false,"given":"Li","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7593-1593","authenticated-orcid":false,"given":"Dawei","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6675-9074","authenticated-orcid":false,"given":"Chengzhuan","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jungang","family":"Lou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yunliang","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0221-6361","authenticated-orcid":false,"given":"Jinli","family":"Cao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5271-9215","authenticated-orcid":false,"given":"Zhonglong","family":"Zheng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.knosys.2026.116030_b1","first-page":"1106","article-title":"Imagenet classification with deep convolutional neural networks","volume":"25","author":"Krizhevsky","year":"2012","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.116030_b2","series-title":"Very deep convolutional networks for large-scale image recognition","author":"Simonyan","year":"2014"},{"key":"10.1016\/j.knosys.2026.116030_b3","doi-asserted-by":"crossref","unstructured":"K. He, X. Zhang, S. Ren, J. Sun, Deep residual learning for image recognition, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2016, pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"10.1016\/j.knosys.2026.116030_b4","doi-asserted-by":"crossref","unstructured":"C. Szegedy, W. Liu, Y. Jia, P. Sermanet, S. Reed, D. Anguelov, D. Erhan, V. Vanhoucke, A. Rabinovich, Going deeper with convolutions, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2015, pp. 1\u20139.","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"10.1016\/j.knosys.2026.116030_b5","series-title":"European Conference on Computer Vision","first-page":"850","article-title":"Fully-convolutional Siamese networks for object tracking","author":"Bertinetto","year":"2016"},{"key":"10.1016\/j.knosys.2026.116030_b6","doi-asserted-by":"crossref","unstructured":"B. Li, W. Wu, Q. Wang, F. Zhang, J. Xing, J. Yan, Siamrpn++: Evolution of Siamese visual tracking with very deep networks, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 4282\u20134291.","DOI":"10.1109\/CVPR.2019.00441"},{"key":"10.1016\/j.knosys.2026.116030_b7","first-page":"5998","article-title":"Attention is all you need","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.116030_b8","doi-asserted-by":"crossref","unstructured":"X. Chen, B. Yan, J. Zhu, D. Wang, X. Yang, H. Lu, Transformer tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 8126\u20138135.","DOI":"10.1109\/CVPR46437.2021.00803"},{"key":"10.1016\/j.knosys.2026.116030_b9","doi-asserted-by":"crossref","unstructured":"N. Wang, W. Zhou, J. Wang, H. Li, Transformer meets tracker: Exploiting temporal context for robust visual tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 1571\u20131580.","DOI":"10.1109\/CVPR46437.2021.00162"},{"key":"10.1016\/j.knosys.2026.116030_b10","unstructured":"A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, G. Heigold, S. Gelly, J. Uszkoreit, N. Houlsby, An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale, in: International Conference on Learning Representations, 2021."},{"key":"10.1016\/j.knosys.2026.116030_b11","series-title":"European Conference on Computer Vision","first-page":"341","article-title":"Joint feature learning and relation modeling for tracking: A one-stream framework","author":"Ye","year":"2022"},{"key":"10.1016\/j.knosys.2026.116030_b12","doi-asserted-by":"crossref","unstructured":"Y. Cui, C. Jiang, L. Wang, G. Wu, Mixformer: End-to-end tracking with iterative mixed attention, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 13608\u201313618.","DOI":"10.1109\/CVPR52688.2022.01324"},{"key":"10.1016\/j.knosys.2026.116030_b13","doi-asserted-by":"crossref","unstructured":"Y. Cai, J. Liu, J. Tang, G. Wu, Robust object modeling for visual tracking, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 9589\u20139600.","DOI":"10.1109\/ICCV51070.2023.00879"},{"key":"10.1016\/j.knosys.2026.116030_b14","doi-asserted-by":"crossref","unstructured":"Y. Bai, Z. Zhao, Y. Gong, X. Wei, Artrackv2: Prompting autoregressive tracker where to look and how to describe, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 19048\u201319057.","DOI":"10.1109\/CVPR52733.2024.01802"},{"key":"10.1016\/j.knosys.2026.116030_b15","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2025.113230","article-title":"Target\u2013background interaction modeling transformer for object tracking","volume":"315","author":"Zhang","year":"2025","journal-title":"Knowl.-Based Syst."},{"issue":"10s","key":"10.1016\/j.knosys.2026.116030_b16","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3510413","article-title":"Avoiding overfitting: A survey on regularization methods for convolutional neural networks","volume":"54","author":"Santos","year":"2022","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.knosys.2026.116030_b17","doi-asserted-by":"crossref","unstructured":"X. Li, C. Ma, B. Wu, Z. He, M.-H. Yang, Target-aware deep tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 1369\u20131378.","DOI":"10.1109\/CVPR.2019.00146"},{"issue":"1","key":"10.1016\/j.knosys.2026.116030_b18","first-page":"1929","article-title":"Dropout: a simple way to prevent neural networks from overfitting","volume":"15","author":"Srivastava","year":"2014","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.knosys.2026.116030_b19","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2025.114241","article-title":"LoRA dropout as a sparsity regularizer for overfitting reduction","author":"Lin","year":"2025","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.knosys.2026.116030_b20","series-title":"Shake-shake regularization","author":"Gastaldi","year":"2017"},{"key":"10.1016\/j.knosys.2026.116030_b21","series-title":"International Conference on Machine Learning","first-page":"6438","article-title":"Manifold mixup: Better representations by interpolating hidden states","author":"Verma","year":"2019"},{"key":"10.1016\/j.knosys.2026.116030_b22","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.112658","article-title":"FS-PTL: A unified few-shot partial transfer learning framework for partial cross-domain fault diagnosis under limited data scenarios","volume":"305","author":"Cheng","year":"2024","journal-title":"Knowl.-Based Syst."},{"issue":"5","key":"10.1016\/j.knosys.2026.116030_b23","doi-asserted-by":"crossref","first-page":"1562","DOI":"10.1109\/TPAMI.2019.2957464","article-title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild","volume":"43","author":"Huang","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.knosys.2026.116030_b24","series-title":"European Conference on Computer Vision","first-page":"740","article-title":"Microsoft coco: Common objects in context","author":"Lin","year":"2014"},{"key":"10.1016\/j.knosys.2026.116030_b25","doi-asserted-by":"crossref","unstructured":"M. Muller, A. Bibi, S. Giancola, S. Alsubaihi, B. Ghanem, Trackingnet: A large-scale dataset and benchmark for object tracking in the wild, in: Proceedings of the European Conference on Computer Vision, 2018, pp. 300\u2013317.","DOI":"10.1007\/978-3-030-01246-5_19"},{"key":"10.1016\/j.knosys.2026.116030_b26","doi-asserted-by":"crossref","unstructured":"H. Fan, L. Lin, F. Yang, P. Chu, G. Deng, S. Yu, H. Bai, Y. Xu, C. Liao, H. Ling, Lasot: A high-quality benchmark for large-scale single object tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 5374\u20135383.","DOI":"10.1109\/CVPR.2019.00552"},{"key":"10.1016\/j.knosys.2026.116030_b27","doi-asserted-by":"crossref","first-page":"392","DOI":"10.1109\/TIP.2021.3130533","article-title":"LasHeR: A large-scale high-diversity benchmark for RGBT tracking","volume":"31","author":"Li","year":"2021","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.knosys.2026.116030_b28","doi-asserted-by":"crossref","unstructured":"S. Yan, J. Yang, J. Kapyla, F. Zheng, A. Leonardis, J.-K. Kamarainen, Depthtrack: Unveiling the power of rgbd tracking, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2021, pp. 10725\u201310733.","DOI":"10.1109\/ICCV48922.2021.01055"},{"issue":"3","key":"10.1016\/j.knosys.2026.116030_b29","doi-asserted-by":"crossref","first-page":"1997","DOI":"10.1109\/TCYB.2023.3318601","article-title":"Visevent: Reliable object tracking via collaboration of frame and event flows","volume":"54","author":"Wang","year":"2023","journal-title":"IEEE Trans. Cybern."},{"key":"10.1016\/j.knosys.2026.116030_b30","first-page":"90579","article-title":"DeTrack: In-model latent denoising learning for visual object tracking","volume":"37","author":"Zhou","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.116030_b31","unstructured":"D. Zhang, Y. Fu, Z. Zheng, UAST: Uncertainty-aware Siamese tracking, in: International Conference on Machine Learning, 2022, pp. 26161\u201326175."},{"issue":"7","key":"10.1016\/j.knosys.2026.116030_b32","doi-asserted-by":"crossref","first-page":"5776","DOI":"10.1109\/TCSVT.2024.3367537","article-title":"Probabilistic assignment with decoupled IoU prediction for visual tracking","volume":"34","author":"Zhang","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.knosys.2026.116030_b33","doi-asserted-by":"crossref","unstructured":"Z. Wu, J. Zheng, X. Ren, F.-A. Vasluianu, C. Ma, D.P. Paudel, L. Van Gool, R. Timofte, Single-model and any-modality for video object tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 19156\u201319166.","DOI":"10.1109\/CVPR52733.2024.01812"},{"key":"10.1016\/j.knosys.2026.116030_b34","unstructured":"J. Ho, T. Salimans, Classifier-Free Diffusion Guidance, in: NeurIPS 2021 Workshop on Deep Generative Models and Downstream Applications, 2021."},{"key":"10.1016\/j.knosys.2026.116030_b35","doi-asserted-by":"crossref","unstructured":"B. Li, J. Yan, W. Wu, Z. Zhu, X. Hu, High performance visual tracking with Siamese region proposal network, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018, pp. 8971\u20138980.","DOI":"10.1109\/CVPR.2018.00935"},{"key":"10.1016\/j.knosys.2026.116030_b36","doi-asserted-by":"crossref","first-page":"260","DOI":"10.1016\/j.neucom.2020.11.046","article-title":"CSART: Channel and spatial attention-guided residual learning for real-time object tracking","volume":"436","author":"Zhang","year":"2021","journal-title":"Neurocomputing"},{"key":"10.1016\/j.knosys.2026.116030_b37","doi-asserted-by":"crossref","unstructured":"Y. Xu, Z. Wang, Z. Li, Y. Yuan, G. Yu, SiamFC++: Towards robust and accurate visual tracking with target estimation guidelines, in: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, 2020, pp. 12549\u201312556, 07.","DOI":"10.1609\/aaai.v34i07.6944"},{"key":"10.1016\/j.knosys.2026.116030_b38","doi-asserted-by":"crossref","unstructured":"B. Yan, H. Peng, J. Fu, D. Wang, H. Lu, Learning spatio-temporal transformer for visual tracking, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2021, pp. 10448\u201310457.","DOI":"10.1109\/ICCV48922.2021.01028"},{"key":"10.1016\/j.knosys.2026.116030_b39","first-page":"16743","article-title":"Swintrack: A simple and strong baseline for transformer tracking","volume":"35","author":"Lin","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.116030_b40","doi-asserted-by":"crossref","unstructured":"S. Gao, C. Zhou, J. Zhang, Generalized relation modeling for transformer tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 18686\u201318695.","DOI":"10.1109\/CVPR52729.2023.01792"},{"key":"10.1016\/j.knosys.2026.116030_b41","doi-asserted-by":"crossref","unstructured":"X. Wei, Y. Bai, Y. Zheng, D. Shi, Y. Gong, Autoregressive visual tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 9697\u20139706.","DOI":"10.1109\/CVPR52729.2023.00935"},{"key":"10.1016\/j.knosys.2026.116030_b42","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2025.113828","article-title":"Adaptive information flow propagation for visual tracking","author":"Shi","year":"2025","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.knosys.2026.116030_b43","doi-asserted-by":"crossref","unstructured":"T. Hui, Z. Xun, F. Peng, J. Huang, X. Wei, X. Wei, J. Dai, J. Han, S. Liu, Bridging search region interaction with template for rgb-t tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 13630\u201313639.","DOI":"10.1109\/CVPR52729.2023.01310"},{"key":"10.1016\/j.knosys.2026.116030_b44","doi-asserted-by":"crossref","unstructured":"J. Yang, Z. Li, F. Zheng, A. Leonardis, J. Song, Prompting for multi-modal tracking, in: Proceedings of the 30th ACM International Conference on Multimedia, 2022, pp. 3492\u20133500.","DOI":"10.1145\/3503161.3547851"},{"key":"10.1016\/j.knosys.2026.116030_b45","doi-asserted-by":"crossref","unstructured":"J. Zhu, S. Lai, X. Chen, D. Wang, H. Lu, Visual prompt multi-modal tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 9516\u20139526.","DOI":"10.1109\/CVPR52729.2023.00918"},{"key":"10.1016\/j.knosys.2026.116030_b46","doi-asserted-by":"crossref","unstructured":"X. Hou, J. Xing, Y. Qian, Y. Guo, S. Xin, J. Chen, K. Tang, M. Wang, Z. Jiang, L. Liu, et al., Sdstrack: Self-distillation symmetric adapter learning for multi-modal visual object tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 26551\u201326561.","DOI":"10.1109\/CVPR52733.2024.02507"},{"key":"10.1016\/j.knosys.2026.116030_b47","doi-asserted-by":"crossref","unstructured":"L. Hong, S. Yan, R. Zhang, W. Li, X. Zhou, P. Guo, K. Jiang, Y. Chen, J. Li, Z. Chen, et al., Onetracker: Unifying visual object tracking with foundation models and efficient tuning, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 19079\u201319091.","DOI":"10.1109\/CVPR52733.2024.01805"},{"key":"10.1016\/j.knosys.2026.116030_b48","doi-asserted-by":"crossref","unstructured":"X. Chen, B. Kang, W. Geng, J. Zhu, Y. Liu, D. Wang, H. Lu, Sutrack: Towards simple and unified single object tracking, in: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 39, 2025, pp. 2239\u20132247, 2.","DOI":"10.1609\/aaai.v39i2.32223"},{"key":"10.1016\/j.knosys.2026.116030_b49","doi-asserted-by":"crossref","first-page":"61","DOI":"10.1016\/j.neunet.2021.08.010","article-title":"TGAN: A simple model update strategy for visual tracking via template-guidance attention network","volume":"144","author":"Yang","year":"2021","journal-title":"Neural Netw."},{"key":"10.1016\/j.knosys.2026.116030_b50","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2022.110037","article-title":"Fast visual tracking with lightweight Siamese network and template-guided learning","volume":"258","author":"Zhang","year":"2022","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.knosys.2026.116030_b51","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2023.111025","article-title":"Multiple templates transformer for visual object tracking","volume":"280","author":"Pang","year":"2023","journal-title":"Knowl.-Based Syst."},{"key":"10.1016\/j.knosys.2026.116030_b52","first-page":"10814","article-title":"Reading relevant feature from global representation memory for visual object tracking","volume":"36","author":"Zhou","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.116030_b53","doi-asserted-by":"crossref","unstructured":"Z. Fu, Q. Liu, Z. Fu, Y. Wang, Stmtrack: Template-free visual tracking with space-time memory networks, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 13774\u201313783.","DOI":"10.1109\/CVPR46437.2021.01356"},{"key":"10.1016\/j.knosys.2026.116030_b54","first-page":"1","article-title":"Searching region-free and template-free Siamese network for tracking drones in TIR videos","volume":"62","author":"Huang","year":"2023","journal-title":"IEEE Trans. Geosci. Remote Sens."},{"key":"10.1016\/j.knosys.2026.116030_b55","doi-asserted-by":"crossref","unstructured":"K. Shuang, Y. Huang, Y. Sun, Z. Cai, H. Guo, Fine-grained motion representation for template-free visual tracking, in: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, 2020, pp. 671\u2013680.","DOI":"10.1109\/WACV45572.2020.9093517"},{"key":"10.1016\/j.knosys.2026.116030_b56","series-title":"Intertrack: Tracking human object interaction without object templates","author":"Xie","year":"2024"},{"key":"10.1016\/j.knosys.2026.116030_b57","series-title":"European Conference on Computer Vision","first-page":"361","article-title":"Robustness to spurious correlation: A comprehensive review","author":"Maheronnaghsh","year":"2024"},{"key":"10.1016\/j.knosys.2026.116030_b58","doi-asserted-by":"crossref","unstructured":"G. Bhat, M. Danelljan, L.V. Gool, R. Timofte, Learning discriminative model prediction for tracking, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2019, pp. 6182\u20136191.","DOI":"10.1109\/ICCV.2019.00628"},{"key":"10.1016\/j.knosys.2026.116030_b59","doi-asserted-by":"crossref","unstructured":"B. Cao, J. Guo, P. Zhu, Q. Hu, Bi-directional adapter for multimodal tracking, in: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 38, 2024, pp. 927\u2013935, 2.","DOI":"10.1609\/aaai.v38i2.27852"},{"key":"10.1016\/j.knosys.2026.116030_b60","doi-asserted-by":"crossref","unstructured":"X. Wang, X. Shu, Z. Zhang, B. Jiang, Y. Wang, Y. Tian, F. Wu, Towards more flexible and accurate object tracking with natural language: Algorithms and benchmark, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 13763\u201313773.","DOI":"10.1109\/CVPR46437.2021.01355"},{"key":"10.1016\/j.knosys.2026.116030_b61","first-page":"130797","article-title":"Vasttrack: Vast category visual object tracking","volume":"37","author":"Peng","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.116030_b62","doi-asserted-by":"crossref","unstructured":"H. Wu, B. Xiao, N. Codella, M. Liu, X. Dai, L. Yuan, L. Zhang, Cvt: Introducing convolutions to vision transformers, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2021, pp. 22\u201331.","DOI":"10.1109\/ICCV48922.2021.00009"},{"key":"10.1016\/j.knosys.2026.116030_b63","doi-asserted-by":"crossref","unstructured":"J. Xie, B. Zhong, Q. Liang, N. Li, Z. Mo, S. Song, Robust tracking via mamba-based context-aware token learning, in: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 39, 2025, pp. 8727\u20138735, 8.","DOI":"10.1609\/aaai.v39i8.32943"},{"key":"10.1016\/j.knosys.2026.116030_b64","series-title":"European Conference on Computer Vision","first-page":"300","article-title":"Tracking meets lora: Faster training, larger model, stronger performance","author":"Lin","year":"2024"},{"key":"10.1016\/j.knosys.2026.116030_b65","doi-asserted-by":"crossref","unstructured":"J. Xie, B. Zhong, Z. Mo, S. Zhang, L. Shi, S. Song, R. Ji, Autoregressive queries for adaptive tracking with spatio-temporal transformers, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 19300\u201319309.","DOI":"10.1109\/CVPR52733.2024.01826"},{"key":"10.1016\/j.knosys.2026.116030_b66","doi-asserted-by":"crossref","unstructured":"L. Shi, B. Zhong, Q. Liang, N. Li, S. Zhang, X. Li, Explicit visual prompts for visual object tracking, in: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 38, 2024, pp. 4838\u20134846, 5.","DOI":"10.1609\/aaai.v38i5.28286"},{"key":"10.1016\/j.knosys.2026.116030_b67","doi-asserted-by":"crossref","unstructured":"Q. Wu, T. Yang, Z. Liu, B. Wu, Y. Shan, A.B. Chan, Dropmae: Masked autoencoders with spatial-attention dropout for tracking tasks, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 14561\u201314571.","DOI":"10.1109\/CVPR52729.2023.01399"},{"key":"10.1016\/j.knosys.2026.116030_b68","doi-asserted-by":"crossref","unstructured":"C. Mayer, M. Danelljan, G. Bhat, M. Paul, D.P. Paudel, F. Yu, L. Van Gool, Transforming model prediction for tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 8731\u20138740.","DOI":"10.1109\/CVPR52688.2022.00853"}],"container-title":["Knowledge-Based Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126007562?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126007562?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T00:13:24Z","timestamp":1781223204000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0950705126007562"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":68,"alternative-id":["S0950705126007562"],"URL":"https:\/\/doi.org\/10.1016\/j.knosys.2026.116030","relation":{},"ISSN":["0950-7051"],"issn-type":[{"value":"0950-7051","type":"print"}],"subject":[],"published":{"date-parts":[[2026,6]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Template-Free Tracking Guidance for transformer trackers","name":"articletitle","label":"Article Title"},{"value":"Knowledge-Based Systems","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.knosys.2026.116030","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"116030"}}