{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T05:45:09Z","timestamp":1785908709956,"version":"3.56.0"},"reference-count":61,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61473155"],"award-info":[{"award-number":["61473155"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100013058","name":"Jiangsu Provincial Key Research and Development Program","doi-asserted-by":"publisher","award":["BE2017301"],"award-info":[{"award-number":["BE2017301"]}],"id":[{"id":"10.13039\/501100013058","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Knowledge-Based Systems"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.knosys.2026.116455","type":"journal-article","created":{"date-parts":[[2026,6,27]],"date-time":"2026-06-27T15:13:33Z","timestamp":1782573213000},"page":"116455","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["FasterSTMTrack: A faster and more efficient visual object tracking with space-time memory network"],"prefix":"10.1016","volume":"350","author":[{"ORCID":"https:\/\/orcid.org\/0009-0009-5443-9709","authenticated-orcid":false,"given":"Yu","family":"Zheng","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4098-2339","authenticated-orcid":false,"given":"Yong","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xun","family":"Che","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.knosys.2026.116455_b1","series-title":"2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","article-title":"Siamrpn++: Evolution of siamese visual tracking with very deep networks","author":"Li","year":"2019"},{"key":"10.1016\/j.knosys.2026.116455_b2","series-title":"2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","article-title":"High performance visual tracking with siamese region proposal network","author":"Li","year":"2018"},{"key":"10.1016\/j.knosys.2026.116455_b3","series-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition","article-title":"Deep residual learning for image recognition","author":"He","year":"2016"},{"key":"10.1016\/j.knosys.2026.116455_b4","doi-asserted-by":"crossref","first-page":"84","DOI":"10.1145\/3065386","article-title":"Imagenet classification with deep convolutional neural networks","author":"Krizhevsky","year":"2017","journal-title":"Commun. ACM"},{"key":"10.1016\/j.knosys.2026.116455_b5","doi-asserted-by":"crossref","first-page":"4129","DOI":"10.1109\/TPAMI.2024.3349519","article-title":"Mixformer: End-to-end tracking with iterative mixed attention","volume":"46","author":"Cui","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.knosys.2026.116455_b6","series-title":"2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","article-title":"Video object segmentation using global and instance embedding learning","author":"Ge","year":"2021"},{"key":"10.1016\/j.knosys.2026.116455_b7","doi-asserted-by":"crossref","first-page":"7885","DOI":"10.1109\/TPAMI.2021.3115815","article-title":"Segmenting objects from relational visual data","author":"Lu","year":"2022","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.knosys.2026.116455_b8","series-title":"Video object segmentation with episodic graph memory networks","first-page":"661","author":"Lu","year":"2020"},{"key":"10.1016\/j.knosys.2026.116455_b9","series-title":"2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","article-title":"Stmtrack: Template-free visual tracking with space-time memory networks","author":"Fu","year":"2021"},{"key":"10.1016\/j.knosys.2026.116455_b10","doi-asserted-by":"crossref","first-page":"715","DOI":"10.1162\/089976602317318938","article-title":"Slow feature analysis: Unsupervised learning of invariances","author":"Wiskott","year":"2002","journal-title":"Neural Comput."},{"key":"10.1016\/j.knosys.2026.116455_b11","series-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition","article-title":"Slow and steady feature analysis: Higher order temporal coherence in video","author":"Jayaraman","year":"2016"},{"key":"10.1016\/j.knosys.2026.116455_b12","series-title":"2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"6577","article-title":"Siam r-cnn: Visual tracking by re-detection","author":"Voigtlaender","year":"2020"},{"key":"10.1016\/j.knosys.2026.116455_b13","series-title":"2019 IEEE\/CVF International Conference on Computer Vision","article-title":"Learning discriminative model prediction for tracking","author":"Bhat","year":"2019"},{"key":"10.1016\/j.knosys.2026.116455_b14","series-title":"2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","article-title":"Transformer tracking","author":"Chen","year":"2021"},{"key":"10.1016\/j.knosys.2026.116455_b15","series-title":"Computer Vision \u2013 ECCV 2022: 17th European Conference, Tel Aviv, Israel, October 23\u201327, 2022, Proceedings, Part XXII","first-page":"341","article-title":"Joint feature learning and relation modeling for tracking: A one-stream framework","author":"Ye","year":"2022"},{"key":"10.1016\/j.knosys.2026.116455_b16","doi-asserted-by":"crossref","first-page":"17085","DOI":"10.1109\/TNNLS.2023.3299412","article-title":"Attention-driven memory network for online visual tracking","volume":"35","author":"Zhang","year":"2024","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.knosys.2026.116455_b17","series-title":"Visual tracking via dynamic memory networks","author":"Yang","year":"2019"},{"key":"10.1016\/j.knosys.2026.116455_b18","series-title":"2021 IEEE\/CVF International Conference on Computer Vision Workshops","first-page":"2678","article-title":"Learning spatio-appearance memory network for high-performance visual tracking","author":"Xie","year":"2021"},{"key":"10.1016\/j.knosys.2026.116455_b19","doi-asserted-by":"crossref","first-page":"2976","DOI":"10.1109\/TCSVT.2021.3094645","article-title":"Object tracking via spatial-temporal memory network","volume":"32","author":"Zhou","year":"2022","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.knosys.2026.116455_b20","doi-asserted-by":"crossref","first-page":"1720","DOI":"10.1109\/TMM.2023.3285441","article-title":"One-stream vision-language memory network for object tracking","volume":"26","author":"Zhang","year":"2024","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.knosys.2026.116455_b21","series-title":"Learning dynamic memory networks for object tracking","first-page":"153","author":"Yang","year":"2018"},{"key":"10.1016\/j.knosys.2026.116455_b22","series-title":"ICCV","article-title":"Tracking anything with decoupled video segmentation","author":"Cheng","year":"2023"},{"key":"10.1016\/j.knosys.2026.116455_b23","series-title":"CVPR","article-title":"Matching anything by segmenting anything","author":"Li","year":"2024"},{"key":"10.1016\/j.knosys.2026.116455_b24","series-title":"Segment and track anything","author":"Cheng","year":"2023"},{"key":"10.1016\/j.knosys.2026.116455_b25","series-title":"Track anything: Segment anything meets videos","author":"Yang","year":"2023"},{"key":"10.1016\/j.knosys.2026.116455_b26","series-title":"Computer Vision \u2013 ECCV 2022","first-page":"571","article-title":"Robust visual tracking by segmentation","author":"Paul","year":"2022"},{"key":"10.1016\/j.knosys.2026.116455_b27","series-title":"2023 IEEE\/CVF International Conference on Computer Vision","first-page":"9704","article-title":"Integrating boxes and masks: A multi-object framework for unified visual tracking and segmentation","author":"Xu","year":"2023"},{"key":"10.1016\/j.knosys.2026.116455_b28","series-title":"CVPR","article-title":"Entitysam: Segment everything in video","author":"Ye","year":"2025"},{"key":"10.1016\/j.knosys.2026.116455_b29","doi-asserted-by":"crossref","first-page":"834","DOI":"10.1109\/TPAMI.2017.2699184","article-title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs","author":"Chen","year":"2018","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.knosys.2026.116455_b30","series-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"3213","article-title":"The cityscapes dataset for semantic urban scene understanding","author":"Cordts","year":"2016"},{"key":"10.1016\/j.knosys.2026.116455_b31","series-title":"2017 IEEE Conference on Computer Vision and Pattern Recognition","article-title":"Flownet 2.0: Evolution of optical flow estimation with deep networks","author":"Ilg","year":"2017"},{"key":"10.1016\/j.knosys.2026.116455_b32","series-title":"2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","article-title":"Lasot: A high-quality benchmark for large-scale single object tracking","author":"Fan","year":"2019"},{"key":"10.1016\/j.knosys.2026.116455_b33","series-title":"Microsoft COCO: Common objects in context","first-page":"740","author":"Lin","year":"2014"},{"key":"10.1016\/j.knosys.2026.116455_b34","series-title":"TrackingNet: A large-scale dataset and benchmark for object tracking in the wild","first-page":"310","author":"M\u00fcller","year":"2018"},{"key":"10.1016\/j.knosys.2026.116455_b35","series-title":"2015 IEEE Conference on Computer Vision and Pattern Recognition","article-title":"Going deeper with convolutions","author":"Szegedy","year":"2015"},{"key":"10.1016\/j.knosys.2026.116455_b36","doi-asserted-by":"crossref","unstructured":"C. Mayer, et al., Transforming model prediction for tracking, in: 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2022, pp. 8721\u20138730.","DOI":"10.1109\/CVPR52688.2022.00853"},{"key":"10.1016\/j.knosys.2026.116455_b37","doi-asserted-by":"crossref","unstructured":"C. Mayer, et al., Learning target candidate association to keep track of what not to track, in: 2021 IEEE\/CVF International Conference on Computer Vision, ICCV, 2021, pp. 13424\u201313434.","DOI":"10.1109\/ICCV48922.2021.01319"},{"key":"10.1016\/j.knosys.2026.116455_b38","series-title":"Ocean: Object-aware anchor-free tracking","first-page":"771","author":"Zhang","year":"2020"},{"key":"10.1016\/j.knosys.2026.116455_b39","doi-asserted-by":"crossref","first-page":"377","DOI":"10.1109\/TCE.2023.3251407","article-title":"Bandt: A border-aware network with deformable transformers for visual tracking","volume":"69","author":"Yang","year":"2023","journal-title":"IEEE Trans. Consum. Electron."},{"key":"10.1016\/j.knosys.2026.116455_b40","series-title":"2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"6727","article-title":"Deformable siamese attention networks for visual object tracking","author":"Yu","year":"2020"},{"key":"10.1016\/j.knosys.2026.116455_b41","series-title":"Computer Vision \u2013 ECCV 2022: 17th European Conference, Tel Aviv, Israel, October 23\u201327, 2022, Proceedings, Part XXII","first-page":"146","article-title":"Aiatrack: Attention in attention for transformer visual tracking","author":"Gao","year":"2022"},{"key":"10.1016\/j.knosys.2026.116455_b42","series-title":"Computer Vision \u2013 ECCV 2022: 17th European Conference, Tel Aviv, Israel, October 23\u201327, 2022, Proceedings, Part XXII","first-page":"375","article-title":"Backbone is all your need: A simplified architecture for visual object tracking","author":"Chen","year":"2022"},{"key":"10.1016\/j.knosys.2026.116455_b43","series-title":"2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"8781","article-title":"Transformer tracking with cyclic shifting window attention","author":"Song","year":"2022"},{"key":"10.1016\/j.knosys.2026.116455_b44","doi-asserted-by":"crossref","first-page":"1656","DOI":"10.1109\/TETCI.2024.3353674","article-title":"Siamdmu: Siamese dual mask update network for visual object tracking","volume":"8","author":"Liu","year":"2024","journal-title":"IEEE Trans. Emerg. Top. Comput. Intell."},{"key":"10.1016\/j.knosys.2026.116455_b45","series-title":"2024 IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"6694","article-title":"Separable self and mixed attention transformers for efficient object tracking","author":"Gopal","year":"2024"},{"key":"10.1016\/j.knosys.2026.116455_b46","series-title":"Less is more: Token context-aware learning for object tracking","author":"Xu","year":"2025"},{"key":"10.1016\/j.knosys.2026.116455_b47","series-title":"2022 IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"1898","article-title":"Siamese transformer pyramid networks for real-time uav tracking","author":"Xing","year":"2022"},{"key":"10.1016\/j.knosys.2026.116455_b48","series-title":"Correlation-based transformer tracking","first-page":"85","author":"Zhong","year":"2022"},{"key":"10.1016\/j.knosys.2026.116455_b49","doi-asserted-by":"crossref","unstructured":"S. Cheng, et al., Learning to filter: Siamese relation network for robust tracking, in: 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2021, pp. 4419\u20134429.","DOI":"10.1109\/CVPR46437.2021.00440"},{"key":"10.1016\/j.knosys.2026.116455_b50","doi-asserted-by":"crossref","unstructured":"Z. Chen, B. Zhong, G. Li, S. Zhang, R. Ji, Siamese box adaptive network for visual tracking, in: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2020, pp. 6667\u20136676.","DOI":"10.1109\/CVPR42600.2020.00670"},{"key":"10.1016\/j.knosys.2026.116455_b51","series-title":"Trtr: Visual tracking with transformer.","author":"Zhao","year":"2021"},{"key":"10.1016\/j.knosys.2026.116455_b52","series-title":"2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"4586","article-title":"Deeper and wider siamese networks for real-time visual tracking","author":"Zhang","year":"2019"},{"key":"10.1016\/j.knosys.2026.116455_b53","series-title":"Computer Vision \u2013 ECCV 2020","first-page":"205","article-title":"Know your surroundings: Exploiting scene information for object tracking","author":"Bhat","year":"2020"},{"key":"10.1016\/j.knosys.2026.116455_b54","doi-asserted-by":"crossref","unstructured":"M. Danelljan, et al., Probabilistic regression for visual tracking, in: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2020, pp. 7181\u20137190.","DOI":"10.1109\/CVPR42600.2020.00721"},{"key":"10.1016\/j.knosys.2026.116455_b55","series-title":"2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"9538","article-title":"Graph attention tracking","author":"Guo","year":"2021"},{"key":"10.1016\/j.knosys.2026.116455_b56","first-page":"3072","article-title":"Siammask: A framework for fast online object tracking and segmentation","volume":"45","author":"Hu","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.knosys.2026.116455_b57","series-title":"2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"4655","article-title":"Atom: Accurate tracking by overlap maximization","author":"Danelljan","year":"2019"},{"key":"10.1016\/j.knosys.2026.116455_b58","series-title":"2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"14572","article-title":"Seqtrack: Sequence to sequence learning for visual object tracking","author":"Chen","year":"2023"},{"key":"10.1016\/j.knosys.2026.116455_b59","series-title":"The 1st solution for 4th pvuw mevis challenge: Unleashing the potential of large multimodal models for referring video segmentation","author":"Fang","year":"2025"},{"key":"10.1016\/j.knosys.2026.116455_b60","series-title":"2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops","first-page":"7283","article-title":"Dtllm-vlt: Diverse text generation for visual language tracking based on llm","author":"Li","year":"2024"},{"key":"10.1016\/j.knosys.2026.116455_b61","series-title":"2025 6th International Conference on Machine Learning and Human-Computer Interaction","first-page":"69","article-title":"Llm-guided multi-object tracking: Enhancing retail insights with temprmot","author":"Phan","year":"2025"}],"container-title":["Knowledge-Based Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126011810?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126011810?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T04:49:48Z","timestamp":1785905388000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0950705126011810"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":61,"alternative-id":["S0950705126011810"],"URL":"https:\/\/doi.org\/10.1016\/j.knosys.2026.116455","relation":{},"ISSN":["0950-7051"],"issn-type":[{"value":"0950-7051","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"FasterSTMTrack: A faster and more efficient visual object tracking with space-time memory network","name":"articletitle","label":"Article Title"},{"value":"Knowledge-Based Systems","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.knosys.2026.116455","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"116455"}}