{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,14]],"date-time":"2026-07-14T23:21:27Z","timestamp":1784071287639,"version":"3.55.0"},"reference-count":84,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"11","license":[{"start":{"date-parts":[[2023,11,1]],"date-time":"2023-11-01T00:00:00Z","timestamp":1698796800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2022YFC3302200"],"award-info":[{"award-number":["2022YFC3302200"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Circuits Syst. Video Technol."],"published-print":{"date-parts":[[2023,11]]},"DOI":"10.1109\/tcsvt.2023.3263884","type":"journal-article","created":{"date-parts":[[2023,4,3]],"date-time":"2023-04-03T17:42:03Z","timestamp":1680543723000},"page":"6571-6594","source":"Crossref","is-referenced-by-count":62,"title":["STDFormer: Spatial-Temporal Motion Transformer for Multiple Object Tracking"],"prefix":"10.1109","volume":"33","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-7712-3322","authenticated-orcid":false,"given":"Mengjie","family":"Hu","sequence":"first","affiliation":[{"name":"School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8485-2598","authenticated-orcid":false,"given":"Xiaotong","family":"Zhu","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haotian","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8816-7304","authenticated-orcid":false,"given":"Shixiang","family":"Cao","sequence":"additional","affiliation":[{"name":"Beijing Institute of Space Mechanics and Electricity, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2834-9461","authenticated-orcid":false,"given":"Chun","family":"Liu","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4616-2200","authenticated-orcid":false,"given":"Qing","family":"Song","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref13","article-title":"Observation-centric SORT: Rethinking SORT for robust multi-object tracking","author":"cao","year":"2022","journal-title":"arXiv 2203 14360"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00075"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2021.3068925"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.169"},{"key":"ref15","article-title":"BoT-SORT: Robust associations multi-pedestrian tracking","author":"aharon","year":"2022","journal-title":"arXiv 2206 14651"},{"key":"ref59","first-page":"213","article-title":"End-to-end object detection with transformers","author":"carion","year":"2020","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref14","article-title":"StrongSORT: Make DeepSORT great again","author":"du","year":"2022","journal-title":"arXiv 2202 13514"},{"key":"ref58","article-title":"Improving video-text retrieval by multi-stream corpus alignment and dual softmax loss","author":"cheng","year":"2021","journal-title":"arXiv 2109 04290"},{"key":"ref53","first-page":"1","article-title":"Attention is all you need","volume":"30","author":"vaswani","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00881"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CAC48633.2019.8996811"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.690"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1016\/j.physa.2021.125790"},{"key":"ref54","first-page":"1","article-title":"Faster R-CNN: Towards real-time object detection with region proposal networks","volume":"28","author":"ren","year":"2015","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2017.2707399"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3059250"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-05710-7_34"},{"key":"ref18","first-page":"2809","article-title":"GIAO Tracker: A comprehensive framework for MCMOT with global information and optimizing strategies in VisDrone 2021","author":"du","year":"2021","journal-title":"Proc IEEE\/CVF Int Conf Comput Vis Workshops (ICCVW)"},{"key":"ref51","article-title":"YOLOX: Exceeding YOLO series in 2021","author":"ge","year":"2021","journal-title":"arXiv 2107 08430"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01484"},{"key":"ref46","article-title":"An efficient framework for learning sentence representations","author":"logeswaran","year":"2018","journal-title":"arXiv 1803 02893"},{"key":"ref45","article-title":"A theoretical analysis of contrastive unsupervised representation learning","author":"arora","year":"2019","journal-title":"arXiv 1902 09229"},{"key":"ref48","article-title":"Semi-TCL: Semi-supervised track contrastive representation learning","author":"li","year":"2021","journal-title":"arXiv 2107 02396"},{"key":"ref47","article-title":"Unsupervised learning of sentence embeddings using compositional n-Gram features","author":"pagliardini","year":"2017","journal-title":"arXiv 1703 02507"},{"key":"ref42","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","author":"chen","year":"2020","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref41","article-title":"TransMOT: Spatial&#x2013;temporal graph transformer for multiple object tracking","author":"chu","year":"2021","journal-title":"arXiv 2104 00194"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58545-7_19"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00023"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3096237"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00103"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58621-8_7"},{"key":"ref4","article-title":"ByteTrack: Multi-object tracking by associating every detection box","author":"zhang","year":"2021","journal-title":"arXiv 2110 06864"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2020.2988649"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01217"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-021-01513-4"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/AVSS.2017.8078516"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2018.8486597"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00792"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00867"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995604"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2020.2996609"},{"key":"ref35","article-title":"TransCenter: Transformers with dense representations for multiple-object tracking","author":"xu","year":"2021","journal-title":"arXiv 2103 15145"},{"key":"ref79","article-title":"Strong-TransCenter: Improved multi-object tracking based on transformers with dense representations","author":"galor","year":"2022","journal-title":"arXiv 2210 13570"},{"key":"ref34","article-title":"TransTrack: Multiple object tracking with transformer","author":"sun","year":"2020","journal-title":"arXiv 2012 15460"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00857"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00864"},{"key":"ref36","article-title":"TR-MOT: Multi-object tracking by reference","author":"chen","year":"2022","journal-title":"arXiv 2203 16621"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2005.223"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA48506.2021.9561110"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1145\/3209914.3209949"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00248"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00973"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/WACV56688.2023.00483"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v31i1.11194"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2022.3165376"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2018.2882192"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2016.7533003"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3213073"},{"key":"ref38","article-title":"MOTR: End-to-end multiple-object tracking with transformer","author":"zeng","year":"2021","journal-title":"arXiv 2105 03247"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00634"},{"key":"ref70","article-title":"SGDR: Stochastic gradient descent with warm restarts","author":"loshchilov","year":"2016","journal-title":"arXiv 1608 03983"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2021.12.104"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58548-8_28"},{"key":"ref24","first-page":"102","article-title":"Contributions to the theory of optimal control","volume":"5","author":"kalman","year":"1960","journal-title":"Bolet&#x00ED;n Sociedad Matem&#x00E1;tica"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-020-01375-2"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01410"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-48881-3_2"},{"key":"ref26","author":"smith","year":"1962","journal-title":"Application of statistical filter theory to the optimal estimation of position and velocity on board a circumlunar vehicle"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2017.8296962"},{"key":"ref69","article-title":"Decoupled weight decay regularization","author":"loshchilov","year":"2017","journal-title":"arXiv 1711 05101"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.41"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.02032"},{"key":"ref63","article-title":"MOT20: A benchmark for multi object tracking in crowded scenes","author":"dendorfer","year":"2020","journal-title":"arXiv 2003 09003"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/WACV.2018.00057"},{"key":"ref66","first-page":"1","article-title":"Evaluating multiple object tracking performance: The CLEAR MOT metrics","volume":"2008","author":"bernardin","year":"2007","journal-title":"J Image Video Process"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2018.00169"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3119563"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/78.978396"},{"key":"ref27","doi-asserted-by":"crossref","first-page":"182","DOI":"10.1117\/12.280797","article-title":"New extension of the Kalman filter to nonlinear systems","volume":"3068","author":"julier","year":"1997","journal-title":"Proc SPIE"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2015.2489438"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.324"},{"key":"ref62","article-title":"MOT16: A benchmark for multi-object tracking","author":"milan","year":"2016","journal-title":"arXiv 1603 00831 [cs]"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00781"}],"container-title":["IEEE Transactions on Circuits and Systems for Video Technology"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/76\/10297951\/10091152.pdf?arnumber=10091152","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,11,13]],"date-time":"2023-11-13T19:42:01Z","timestamp":1699904521000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10091152\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,11]]},"references-count":84,"journal-issue":{"issue":"11"},"URL":"https:\/\/doi.org\/10.1109\/tcsvt.2023.3263884","relation":{},"ISSN":["1051-8215","1558-2205"],"issn-type":[{"value":"1051-8215","type":"print"},{"value":"1558-2205","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,11]]}}}