{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T07:03:44Z","timestamp":1784531024920,"version":"3.55.0"},"reference-count":45,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62476017"],"award-info":[{"award-number":["62476017"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Image and Vision Computing"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.imavis.2026.106073","type":"journal-article","created":{"date-parts":[[2026,6,10]],"date-time":"2026-06-10T15:26:14Z","timestamp":1781105174000},"page":"106073","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["STCTracker: Enhancing sequential temporal consistency in referring multi-object tracking"],"prefix":"10.1016","volume":"173","author":[{"given":"Hong","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiabi","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ding","family":"Yuan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hanyang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yang","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4237-5874","authenticated-orcid":false,"given":"Yifan","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.imavis.2026.106073_b1","doi-asserted-by":"crossref","unstructured":"Alex Bewley, Zongyuan Ge, Lionel Ott, Fabio Ramos, Ben Upcroft, Simple online and realtime tracking, in: 2016 IEEE International Conference on Image Processing, ICIP, 2016, pp. 3464\u20133468.","DOI":"10.1109\/ICIP.2016.7533003"},{"key":"10.1016\/j.imavis.2026.106073_b2","doi-asserted-by":"crossref","unstructured":"Nicolai Wojke, Alex Bewley, Dietrich Paulus, Simple online and realtime tracking with a deep association metric, in: 2017 IEEE International Conference on Image Processing, ICIP, 2017, pp. 3645\u20133649.","DOI":"10.1109\/ICIP.2017.8296962"},{"key":"10.1016\/j.imavis.2026.106073_b3","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2025.105695","article-title":"Synergistic-aware cascaded association and trajectory refinement for multi-object tracking","volume":"162","author":"Li","year":"2025","journal-title":"Image Vis. Comput."},{"key":"10.1016\/j.imavis.2026.106073_b4","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2024.105303","article-title":"Multi-object tracking using score-driven hierarchical association strategy between predicted tracklets and objects","volume":"152","author":"Zhao","year":"2024","journal-title":"Image Vis. Comput."},{"key":"10.1016\/j.imavis.2026.106073_b5","doi-asserted-by":"crossref","first-page":"4795","DOI":"10.1007\/s11263-025-02407-5","article-title":"Fully decoupled end-to-end person search: An approach without conflicting objectives","volume":"133","author":"Zhang","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.imavis.2026.106073_b6","doi-asserted-by":"crossref","first-page":"11152","DOI":"10.1109\/TPAMI.2024.3458921","article-title":"Learning from human attention for attribute-assisted visual recognition","volume":"46","author":"Bai","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.imavis.2026.106073_b7","doi-asserted-by":"crossref","first-page":"9113","DOI":"10.1109\/TPAMI.2025.3584847","article-title":"Investigating synthetic-to-real transfer robustness for stereo matching and optical flow estimation","volume":"47","author":"Zhang","year":"2025","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.imavis.2026.106073_b8","doi-asserted-by":"crossref","first-page":"4305","DOI":"10.1007\/s11263-024-02090-y","article-title":"Exploring the usage of pre-trained features for stereo matching","volume":"132","author":"Zhang","year":"2024","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.imavis.2026.106073_b9","doi-asserted-by":"crossref","unstructured":"Dongming Wu, Wencheng Han, Tiancai Wang, Xingping Dong, Xiangyu Zhang, Jianbing Shen, Referring Multi-Object Tracking, in: 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2023, pp. 14633\u201314642.","DOI":"10.1109\/CVPR52729.2023.01406"},{"key":"10.1016\/j.imavis.2026.106073_b10","doi-asserted-by":"crossref","first-page":"18964","DOI":"10.1109\/TITS.2024.3437645","article-title":"EchoTrack: Auditory referring multi-object tracking for autonomous driving","volume":"25","author":"Lin","year":"2024","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"key":"10.1016\/j.imavis.2026.106073_b11","doi-asserted-by":"crossref","unstructured":"Yunhao Du, Cheng Lei, Zhicheng Zhao, Fei Su, ikun: Speak to trackers without retraining, in: 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2024, pp. 19135\u201319144.","DOI":"10.1109\/CVPR52733.2024.01810"},{"key":"10.1016\/j.imavis.2026.106073_b12","doi-asserted-by":"crossref","unstructured":"Huu-Thien Tran, Phuoc-Sang Pham, Thai-Son Tran, Khoa Luu, MEX: Memory-Efficient Approach to Referring Multi-Object Tracking, in: 2024 International Conference on Advanced Technologies for Communications, ATC, 2024, pp. 550\u2013555.","DOI":"10.1109\/ATC63255.2024.10908144"},{"key":"10.1016\/j.imavis.2026.106073_b13","doi-asserted-by":"crossref","first-page":"8725","DOI":"10.1109\/TMM.2023.3240881","article-title":"StrongSORT: Make DeepSORT great again","volume":"25","author":"Du","year":"2023","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.imavis.2026.106073_b14","doi-asserted-by":"crossref","unstructured":"Jinkun Cao, Xinshuo Weng, Rawal Khirodkar, Jiangmiao Pang, Kris Kitani, Observation-Centric SORT: Rethinking SORT for Robust Multi-Object Tracking, in: 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2022, pp. 9686\u20139696.","DOI":"10.1109\/CVPR52729.2023.00934"},{"key":"10.1016\/j.imavis.2026.106073_b15","doi-asserted-by":"crossref","unstructured":"Yunhao Du, Junfeng Wan, Yanyun Zhao, Binyu Zhang, Zhihang Tong, Junhao Dong, GIAOTracker: A comprehensive framework for MCMOT with global information and optimizing strategies in VisDrone 2021, in: 2021 IEEE\/CVF International Conference on Computer Vision Workshops, ICCVW, 2021, pp. 2809\u20132819.","DOI":"10.1109\/ICCVW54120.2021.00315"},{"key":"10.1016\/j.imavis.2026.106073_b16","doi-asserted-by":"crossref","unstructured":"Zhongdao Wang, Liang Zheng, Yixuan Liu, Yali Li, Shengjin Wang, Towards Real-Time Multi-Object Tracking, in: 2020 European Conference on Computer Vision, ECCV, 2020, pp. 107\u2013122.","DOI":"10.1007\/978-3-030-58621-8_7"},{"key":"10.1016\/j.imavis.2026.106073_b17","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2026.105942","article-title":"Costaa YOLO: Convolutional swin transformer with attention and anchor box optimization on YOLOv7 for robust pedestrian detection","volume":"168","author":"V.S.","year":"2026","journal-title":"Image Vis. Comput."},{"key":"10.1016\/j.imavis.2026.106073_b18","doi-asserted-by":"crossref","first-page":"3069","DOI":"10.1007\/s11263-021-01513-4","article-title":"FairMOT: On the fairness of detection and re-identification in multiple object tracking","volume":"129","author":"Zhang","year":"2021","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.imavis.2026.106073_b19","series-title":"TransTrack: Multiple object tracking with transformer","author":"Sun","year":"2021"},{"key":"10.1016\/j.imavis.2026.106073_b20","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2024.105363","article-title":"AwareTrack: Object awareness for visual tracking via templates interaction","volume":"154","author":"Zhang","year":"2025","journal-title":"Image Vis. Comput."},{"key":"10.1016\/j.imavis.2026.106073_b21","doi-asserted-by":"crossref","unstructured":"Wenyan He, Yajun Jian, Yang Lu, Hanzi Wang, Visual-Linguistic Representation Learning with Deep Cross-Modality Fusion for Referring Multi-Object Tracking, in: 2024 IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP, 2024, pp. 6310\u20136314.","DOI":"10.1109\/ICASSP48485.2024.10447535"},{"key":"10.1016\/j.imavis.2026.106073_b22","series-title":"MLS-track: Multilevel semantic interaction in RMOT","author":"Ma","year":"2024"},{"key":"10.1016\/j.imavis.2026.106073_b23","doi-asserted-by":"crossref","first-page":"75","DOI":"10.1016\/j.neucom.2021.12.104","article-title":"MAT: Motion-aware multi-object tracking","volume":"476","author":"Han","year":"2022","journal-title":"Neurocomputing"},{"key":"10.1016\/j.imavis.2026.106073_b24","doi-asserted-by":"crossref","unstructured":"Daniel Stadler, J\u00fcrgen Beyerer, Modelling Ambiguous Assignments for Multi-Person Tracking in Crowds, in: 2022 IEEE\/CVF Winter Conference on Applications of Computer Vision Workshops, WACVW, 2022, pp. 133\u2013142.","DOI":"10.1109\/WACVW54805.2022.00019"},{"key":"10.1016\/j.imavis.2026.106073_b25","doi-asserted-by":"crossref","unstructured":"Tarasha Khurana, Achal Dave, Deva Ramanan, Detecting Invisible People, in: 2021 IEEE\/CVF International Conference on Computer Vision, ICCV, 2020, pp. 3154\u20133164.","DOI":"10.1109\/ICCV48922.2021.00316"},{"key":"10.1016\/j.imavis.2026.106073_b26","doi-asserted-by":"crossref","first-page":"1858","DOI":"10.1109\/TPAMI.2008.113","article-title":"Parametric image alignment using enhanced correlation coefficient maximization","volume":"30","author":"Evangelidis","year":"2008","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.imavis.2026.106073_b27","series-title":"BoostTrack++: Using tracklet information to detect more objects in multiple object tracking","author":"Stanojevic","year":"2024"},{"key":"10.1016\/j.imavis.2026.106073_b28","doi-asserted-by":"crossref","first-page":"53","DOI":"10.1007\/s00138-024-01531-5","article-title":"BoostTrack: Boosting the similarity measure and detection confidence for improved multiple object tracking","volume":"35","author":"Stanojevic","year":"2024","journal-title":"Mach. Vis. Appl."},{"key":"10.1016\/j.imavis.2026.106073_b29","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, Ilya Sutskever, Learning Transferable Visual Models From Natural Language Supervision, in: 2021 International Conference on Machine Learning, ICML, 2021."},{"key":"10.1016\/j.imavis.2026.106073_b30","doi-asserted-by":"crossref","unstructured":"Jianbo Shi, Carlo Tomasi, Good features to track, in: 1994IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 1994, pp. 593\u2013600.","DOI":"10.1109\/CVPR.1994.323794"},{"key":"10.1016\/j.imavis.2026.106073_b31","unstructured":"Bruce D. Lucas, Takeo Kanade, An Iterative Image Registration Technique with an Application to Stereo Vision, in: 1981 International Joint Conference on Artificial Intelligence, IJCAI, 1981."},{"key":"10.1016\/j.imavis.2026.106073_b32","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103349","article-title":"Cognitive disentanglement for referring multi-object tracking","volume":"124","author":"Liang","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.imavis.2026.106073_b33","article-title":"Temporal-enhanced multimodal transformer for referring multi-object tracking and segmentation","author":"Xiao","year":"2025","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.imavis.2026.106073_b34","doi-asserted-by":"crossref","unstructured":"Nicolai Wojke, Alex Bewley, Dietrich Paulus, Simple online and realtime tracking with a deep association metric, in: 2017 IEEE International Conference on Image Processing, ICIP, 2017, pp. 3645\u20133649.","DOI":"10.1109\/ICIP.2017.8296962"},{"key":"10.1016\/j.imavis.2026.106073_b35","doi-asserted-by":"crossref","unstructured":"Yifu Zhang, Peize Sun, Yi Jiang, Dongdong Yu, Fucheng Weng, Zehuan Yuan, Ping Luo, Wenyu Liu, Xinggang Wang, ByteTrack: Multi-object Tracking by Associating Every Detection Box, in: 2022 European Conference on Computer Vision, ECCV, 2022, pp. 1\u201321.","DOI":"10.1007\/978-3-031-20047-2_1"},{"key":"10.1016\/j.imavis.2026.106073_b36","doi-asserted-by":"crossref","first-page":"3182","DOI":"10.1109\/TIP.2022.3165376","article-title":"Rethinking the competition between detection and ReID in multiobject tracking","volume":"31","author":"Liang","year":"2022","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.imavis.2026.106073_b37","doi-asserted-by":"crossref","unstructured":"Meinhardt Tim, Kirillov Alexander, Leal-Taix\u00e9 Laura, Feichtenhofer Christoph, TrackFormer: Multi-Object Tracking with Transformers, in: 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2022, pp. 8834\u20138844.","DOI":"10.1109\/CVPR52688.2022.00864"},{"key":"10.1016\/j.imavis.2026.106073_b38","doi-asserted-by":"crossref","unstructured":"Tzoulio Chamiti, Leandro Di Bella, Adrian Munteanu, Nikos Deligiannis, ReferGPT: Towards Zero-Shot Referring Multi-Object Tracking, in: 2025 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops, CVPRW, 2025, pp. 3849\u20133858.","DOI":"10.1109\/CVPRW67362.2025.00370"},{"key":"10.1016\/j.imavis.2026.106073_b39","doi-asserted-by":"crossref","DOI":"10.1177\/0278364913491297","article-title":"Vision meets robotics: The KITTI dataset","author":"Geiger","year":"2013","journal-title":"Int. J. Robot. Res."},{"key":"10.1016\/j.imavis.2026.106073_b40","doi-asserted-by":"crossref","unstructured":"Jonathon Luiten, Aljosa Osep, Patrick Dendorfer, Philip Torr, Andreas Geiger, Laura Leal-Taix\u00e9, Bastian Leibe, HOTA: A Higher Order Metric for Evaluating Multi-object Tracking, in: 2020 International Journal of Computer Vision, IJCV, Vol. 129, 2020, pp. 548\u2013578.","DOI":"10.1007\/s11263-020-01375-2"},{"key":"10.1016\/j.imavis.2026.106073_b41","doi-asserted-by":"crossref","unstructured":"Gerard Maggiolino, Adnan Ahmad, Jinkun Cao, Kris Kitani, Deep OC-Sort: Multi-Pedestrian Tracking by Adaptive Re-Identification, in: 2023 IEEE International Conference on Image Processing, ICIP, 2023, pp. 3025\u20133029.","DOI":"10.1109\/ICIP49359.2023.10222576"},{"key":"10.1016\/j.imavis.2026.106073_b42","unstructured":"Kefu Yi, Kai Luo, Xiaolei Luo, Jiangui Huang, Hao Wu, Rongdong Hu, Wei Hao, UCMCTrack: Multi-Object Tracking with Uniform Camera Motion Compensation, in: 2024 AAAI Conference on Artificial Intelligence, AAAI, 2024."},{"key":"10.1016\/j.imavis.2026.106073_b43","doi-asserted-by":"crossref","unstructured":"Steven Bird, NLTK: The Natural Language Toolkit, in: 2006 Annual Meeting of the Association for Computational Linguistics, ACL, 2006.","DOI":"10.3115\/1225403.1225421"},{"key":"10.1016\/j.imavis.2026.106073_b44","series-title":"Talking-heads attention","author":"Shazeer","year":"2020"},{"key":"10.1016\/j.imavis.2026.106073_b45","doi-asserted-by":"crossref","DOI":"10.1109\/TMM.2019.2958756","article-title":"A strong baseline and batch normalization neck for deep person re-identification","author":"Luo","year":"2020","journal-title":"IEEE Trans. Multimed."}],"container-title":["Image and Vision Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0262885626001800?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0262885626001800?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T06:23:16Z","timestamp":1784528596000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0262885626001800"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":45,"alternative-id":["S0262885626001800"],"URL":"https:\/\/doi.org\/10.1016\/j.imavis.2026.106073","relation":{},"ISSN":["0262-8856"],"issn-type":[{"value":"0262-8856","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"STCTracker: Enhancing sequential temporal consistency in referring multi-object tracking","name":"articletitle","label":"Article Title"},{"value":"Image and Vision Computing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.imavis.2026.106073","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"106073"}}