{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,25]],"date-time":"2026-05-25T07:04:53Z","timestamp":1779692693056,"version":"3.53.1"},"reference-count":47,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Image and Vision Computing"],"published-print":{"date-parts":[[2026,7]]},"DOI":"10.1016\/j.imavis.2026.105992","type":"journal-article","created":{"date-parts":[[2026,4,18]],"date-time":"2026-04-18T14:50:55Z","timestamp":1776523855000},"page":"105992","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Unleashing spatial-awareness for robust object tracking"],"prefix":"10.1016","volume":"171","author":[{"given":"Yan","family":"Chen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tao","family":"Lin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jixiang","family":"Du","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongbo","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.imavis.2026.105992_b1","doi-asserted-by":"crossref","unstructured":"Xin Chen, Bin Yan, Jiawen Zhu, Dong Wang, Xiaoyun Yang, Huchuan Lu, Transformer tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 8126\u20138135.","DOI":"10.1109\/CVPR46437.2021.00803"},{"key":"10.1016\/j.imavis.2026.105992_b2","doi-asserted-by":"crossref","unstructured":"Bin Yan, Houwen Peng, Jianlong Fu, Dong Wang, Huchuan Lu, Learning spatio-temporal transformer for visual tracking, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2021, pp. 10448\u201310457.","DOI":"10.1109\/ICCV48922.2021.01028"},{"key":"10.1016\/j.imavis.2026.105992_b3","doi-asserted-by":"crossref","unstructured":"Yutao Cui, Cheng Jiang, Limin Wang, Gangshan Wu, Mixformer: End-to-end tracking with iterative mixed attention, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 13608\u201313618.","DOI":"10.1109\/CVPR52688.2022.01324"},{"key":"10.1016\/j.imavis.2026.105992_b4","series-title":"European Conference on Computer Vision","first-page":"341","article-title":"Joint feature learning and relation modeling for tracking: A one-stream framework","author":"Ye","year":"2022"},{"key":"10.1016\/j.imavis.2026.105992_b5","series-title":"Computer Vision\u2013ECCV 2016 Workshops: Amsterdam, the Netherlands, October 8-10 and 15-16, 2016, Proceedings, Part II 14","first-page":"850","article-title":"Fully-convolutional siamese networks for object tracking","author":"Bertinetto","year":"2016"},{"key":"10.1016\/j.imavis.2026.105992_b6","doi-asserted-by":"crossref","unstructured":"Bo Li, Junjie Yan, Wei Wu, Zheng Zhu, Xiaolin Hu, High performance visual tracking with siamese region proposal network, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018, pp. 8971\u20138980.","DOI":"10.1109\/CVPR.2018.00935"},{"key":"10.1016\/j.imavis.2026.105992_b7","doi-asserted-by":"crossref","unstructured":"Bo Li, Wei Wu, Qiang Wang, Fangyi Zhang, Junliang Xing, Junjie Yan, Siamrpn++: Evolution of siamese visual tracking with very deep networks, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 4282\u20134291.","DOI":"10.1109\/CVPR.2019.00441"},{"key":"10.1016\/j.imavis.2026.105992_b8","doi-asserted-by":"crossref","unstructured":"Zedu Chen, Bineng Zhong, Guorong Li, Shengping Zhang, Rongrong Ji, Siamese box adaptive network for visual tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 6668\u20136677.","DOI":"10.1109\/CVPR42600.2020.00670"},{"issue":"5","key":"10.1016\/j.imavis.2026.105992_b9","doi-asserted-by":"crossref","first-page":"2330","DOI":"10.1109\/TCSVT.2022.3221723","article-title":"Robust tracking via learning model update with unsupervised anomaly detection philosophy","volume":"33","author":"Gao","year":"2023","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.imavis.2026.105992_b10","series-title":"ACM Multimedia","first-page":"1997","article-title":"Unambiguous object tracking by exploiting target cues","author":"Gao","year":"2023"},{"key":"10.1016\/j.imavis.2026.105992_b11","unstructured":"Zhihong Fu, Qingjie Liu, Zehua Fu, Yunhong Wang, Stmtrack: Template-free visual tracking with space-time memory networks, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 13774\u201313783."},{"key":"10.1016\/j.imavis.2026.105992_b12","series-title":"European Conference on Computer Vision","first-page":"146","article-title":"Aiatrack: Attention in attention for transformer visual tracking","author":"Gao","year":"2022"},{"issue":"4","key":"10.1016\/j.imavis.2026.105992_b13","doi-asserted-by":"crossref","first-page":"1740","DOI":"10.1109\/TCSVT.2022.3214222","article-title":"Robust tracking via uncertainty-aware semantic consistency","volume":"33","author":"Ma","year":"2022","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"issue":"10","key":"10.1016\/j.imavis.2026.105992_b14","doi-asserted-by":"crossref","first-page":"13671","DOI":"10.1109\/TNNLS.2023.3270479","article-title":"Visualizing and understanding patch interactions in vision transformer","volume":"35","author":"Ma","year":"2023","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.imavis.2026.105992_b15","article-title":"Towards reliable tracking: An uncertainty-aware siamese tracker","author":"Ma","year":"2025","journal-title":"IEEE Trans. Emerg. Top. Comput. Intell."},{"key":"10.1016\/j.imavis.2026.105992_b16","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2025.128715","article-title":"MSAF: Multi-scale adaptive filter for object tracking","volume":"294","author":"Li","year":"2025","journal-title":"Expert Syst. Appl."},{"issue":"Part B","key":"10.1016\/j.imavis.2026.105992_b17","article-title":"A spatial-temporal contexts network for object tracking","volume":"127","author":"Huang","year":"2024","journal-title":"Eng. Appl. Artif. Intell."},{"key":"10.1016\/j.imavis.2026.105992_b18","article-title":"Faster r-cnn: Towards real-time object detection with region proposal networks","volume":"28","author":"Ren","year":"2015","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.imavis.2026.105992_b19","doi-asserted-by":"crossref","unstructured":"Zhipeng Zhang, Houwen Peng, Deeper and wider siamese networks for real-time visual tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 4591\u20134600.","DOI":"10.1109\/CVPR.2019.00472"},{"key":"10.1016\/j.imavis.2026.105992_b20","doi-asserted-by":"crossref","unstructured":"Martin Danelljan, Goutam Bhat, Fahad Shahbaz Khan, Michael Felsberg, Atom: Accurate tracking by overlap maximization, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 4660\u20134669.","DOI":"10.1109\/CVPR.2019.00479"},{"key":"10.1016\/j.imavis.2026.105992_b21","doi-asserted-by":"crossref","unstructured":"Goutam Bhat, Martin Danelljan, Luc Van Gool, Radu Timofte, Learning discriminative model prediction for tracking, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2019, pp. 6182\u20136191.","DOI":"10.1109\/ICCV.2019.00628"},{"key":"10.1016\/j.imavis.2026.105992_b22","doi-asserted-by":"crossref","unstructured":"Fei Xie, Chunyu Wang, Guangting Wang, Yue Cao, Wankou Yang, Wenjun Zeng, Correlation-aware deep tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 8751\u20138760.","DOI":"10.1109\/CVPR52688.2022.00855"},{"key":"10.1016\/j.imavis.2026.105992_b23","series-title":"European Conference on Computer Vision","first-page":"205","article-title":"Know your surroundings: Exploiting scene information for object tracking","author":"Bhat","year":"2020"},{"key":"10.1016\/j.imavis.2026.105992_b24","unstructured":"Kaiwen Liu, Jin Gao, Haowei Liu, Liang Li, Bing Li, Weiming Hu, Exploring motion information for distractor suppression in visual tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 1924\u20131932."},{"key":"10.1016\/j.imavis.2026.105992_b25","series-title":"Describe and attend to track: Learning natural language guided structural representation and visual attention for object tracking","author":"Wang","year":"2018"},{"key":"10.1016\/j.imavis.2026.105992_b26","unstructured":"Wencheng Han, Xingping Dong, Fahad Shahbaz Khan, Ling Shao, Jianbing Shen, Learning to fuse asymmetric feature maps in siamese trackers, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 16570\u201316580."},{"key":"10.1016\/j.imavis.2026.105992_b27","doi-asserted-by":"crossref","unstructured":"Christoph Mayer, Martin Danelljan, Danda Pani Paudel, Luc Van Gool, Learning target candidate association to keep track of what not to track, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2021, pp. 13444\u201313454.","DOI":"10.1109\/ICCV48922.2021.01319"},{"key":"10.1016\/j.imavis.2026.105992_b28","doi-asserted-by":"crossref","first-page":"976","DOI":"10.1109\/TIP.2020.3037518","article-title":"Self-supervised deep correlation tracking","volume":"30","author":"Yuan","year":"2021","journal-title":"IEEE Trans. Image Process."},{"issue":"10","key":"10.1016\/j.imavis.2026.105992_b29","doi-asserted-by":"crossref","first-page":"13284","DOI":"10.1109\/TNNLS.2023.3266837","article-title":"Active learning for deep visual tracking","volume":"35","author":"Yuan","year":"2024","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"issue":"3","key":"10.1016\/j.imavis.2026.105992_b30","first-page":"1224","article-title":"Aligned spatial-temporal memory network for thermal infrared target tracking","volume":"70","author":"Yuan","year":"2023","journal-title":"IEEE Trans. Circuits Syst. II Express Briefs"},{"key":"10.1016\/j.imavis.2026.105992_b31","series-title":"Self-attention with relative position representations","author":"Shaw","year":"2018"},{"key":"10.1016\/j.imavis.2026.105992_b32","unstructured":"Junyeop Lee, Sungrae Park, Jeonghun Baek, Seong Joon Oh, Seonghyeon Kim, Hwalsuk Lee, On recognizing texts of arbitrary shapes with 2D self-attention, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops, 2020, pp. 546\u2013547."},{"key":"10.1016\/j.imavis.2026.105992_b33","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2023.127063","article-title":"Roformer: Enhanced transformer with rotary position embedding","volume":"568","author":"Su","year":"2024","journal-title":"Neurocomputing"},{"issue":"5","key":"10.1016\/j.imavis.2026.105992_b34","doi-asserted-by":"crossref","first-page":"1562","DOI":"10.1109\/TPAMI.2019.2957464","article-title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild","volume":"43","author":"Huang","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.imavis.2026.105992_b35","doi-asserted-by":"crossref","unstructured":"Matthias Muller, Adel Bibi, Silvio Giancola, Salman Alsubaihi, Bernard Ghanem, Trackingnet: A large-scale dataset and benchmark for object tracking in the wild, in: Proceedings of the European Conference on Computer Vision, ECCV, 2018, pp. 300\u2013317.","DOI":"10.1007\/978-3-030-01246-5_19"},{"key":"10.1016\/j.imavis.2026.105992_b36","unstructured":"U.T. Benchmark, A benchmark and simulator for uav tracking, in: European Conference on Computer Vision, vol. 7, 2016."},{"key":"10.1016\/j.imavis.2026.105992_b37","doi-asserted-by":"crossref","unstructured":"Ning Wang, Wengang Zhou, Jie Wang, Houqiang Li, Transformer meets tracker: Exploiting temporal context for robust visual tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 1571\u20131580.","DOI":"10.1109\/CVPR46437.2021.00162"},{"key":"10.1016\/j.imavis.2026.105992_b38","doi-asserted-by":"crossref","unstructured":"Paul Voigtlaender, Jonathon Luiten, Philip HS Torr, Bastian Leibe, Siam r-cnn: Visual tracking by re-detection, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 6578\u20136588.","DOI":"10.1109\/CVPR42600.2020.00661"},{"key":"10.1016\/j.imavis.2026.105992_b39","doi-asserted-by":"crossref","unstructured":"Martin Danelljan, Luc Van Gool, Radu Timofte, Probabilistic regression for visual tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 7183\u20137192.","DOI":"10.1109\/CVPR42600.2020.00721"},{"key":"10.1016\/j.imavis.2026.105992_b40","series-title":"Computer Vision\u2013ECCV 2020 Workshops: Glasgow, UK, August 23\u201328, 2020, Proceedings, Part V 16","first-page":"653","article-title":"Rpt: Learning point set representation for siamese visual tracking","author":"Ma","year":"2020"},{"key":"10.1016\/j.imavis.2026.105992_b41","series-title":"European Conference on Computer Vision","first-page":"771","article-title":"Ocean: Object-aware anchor-free tracking","author":"Zhang","year":"2020"},{"key":"10.1016\/j.imavis.2026.105992_b42","doi-asserted-by":"crossref","unstructured":"Yuechen Yu, Yilei Xiong, Weilin Huang, Matthew R. Scott, Deformable siamese attention networks for visual object tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 6728\u20136737.","DOI":"10.1109\/CVPR42600.2020.00676"},{"key":"10.1016\/j.imavis.2026.105992_b43","unstructured":"Dongyan Guo, Jun Wang, Ying Cui, Zhenhua Wang, Shengyong Chen, SiamCAR: Siamese fully convolutional classification and regression for visual tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 6269\u20136277."},{"key":"10.1016\/j.imavis.2026.105992_b44","doi-asserted-by":"crossref","DOI":"10.1016\/j.cviu.2022.103547","article-title":"Fully convolutional online tracking","volume":"224","author":"Cui","year":"2022","journal-title":"Comput. Vis. Image Underst."},{"key":"10.1016\/j.imavis.2026.105992_b45","unstructured":"Dongyan Guo, Yanyan Shao, Ying Cui, Zhenhua Wang, Liyan Zhang, Chunhua Shen, Graph attention tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 9543\u20139552."},{"key":"10.1016\/j.imavis.2026.105992_b46","doi-asserted-by":"crossref","unstructured":"Heng Fan, Liting Lin, Fan Yang, Peng Chu, Ge Deng, Sijia Yu, Hexin Bai, Yong Xu, Chunyuan Liao, Haibin Ling, Lasot: A high-quality benchmark for large-scale single object tracking, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 5374\u20135383.","DOI":"10.1109\/CVPR.2019.00552"},{"issue":"9","key":"10.1016\/j.imavis.2026.105992_b47","doi-asserted-by":"crossref","first-page":"1834","DOI":"10.1109\/TPAMI.2014.2388226","article-title":"Object tracking benchmark","volume":"37","author":"Wu","year":"2015","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."}],"container-title":["Image and Vision Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0262885626000995?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0262885626000995?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,25]],"date-time":"2026-05-25T06:33:47Z","timestamp":1779690827000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0262885626000995"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7]]},"references-count":47,"alternative-id":["S0262885626000995"],"URL":"https:\/\/doi.org\/10.1016\/j.imavis.2026.105992","relation":{},"ISSN":["0262-8856"],"issn-type":[{"value":"0262-8856","type":"print"}],"subject":[],"published":{"date-parts":[[2026,7]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Unleashing spatial-awareness for robust object tracking","name":"articletitle","label":"Article Title"},{"value":"Image and Vision Computing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.imavis.2026.105992","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"105992"}}