{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T20:30:07Z","timestamp":1771705807729,"version":"3.50.1"},"reference-count":79,"publisher":"Association for Computing Machinery (ACM)","issue":"5","license":[{"start":{"date-parts":[[2024,1,11]],"date-time":"2024-01-11T00:00:00Z","timestamp":1704931200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2021ZD0112200"],"award-info":[{"award-number":["2021ZD0112200"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["62325206, 61936005, 62301276, 62036012, and 62376268"],"award-info":[{"award-number":["62325206, 61936005, 62301276, 62036012, and 62376268"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Beijing Natural Science Foundation","award":["L201001, 4222039"],"award-info":[{"award-number":["L201001, 4222039"]}]},{"name":"Key Research and Development Program of Jiangsu Province","award":["BE2023016-4"],"award-info":[{"award-number":["BE2023016-4"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":["ACM Trans. Multimedia Comput. Commun. Appl."],"published-print":{"date-parts":[[2024,5,31]]},"abstract":"<jats:p>Recently, the tracking-by-detection methods have achieved excellent performance in Multi-Object Tracking (MOT), which focuses on obtaining a robust feature for each object and generating tracklets based on feature similarity. However, they are confronted with two issues: (1) unstable features in short-term occlusion and (2)\u00a0insufficient matching in long-term occlusion. Specifically, the unstable feature is caused by the appearance variation under occlusion, and the association with the current unstable feature will lead to insufficient matching in long-term occlusion. To address the above issues, we propose a two-stage tracklet-level association method, Spatial-Temporal Tracklet Association (STTA), to effectively combine spatial-temporal context between feature extraction and data association. In the first stage, we propose the Tracklet-guided Spatial-Temporal Attention network (TSTA) to generate robust and stable features. Specifically, TSTA captures spatial-temporal context to obtain the most salient regions between the current and previous clips. In the second stage, we design the Bi-Tracklet Spatial-Temporal association (BTST) module to fully exploit the spatial-temporal context in data association. Specifically, we leverage BTST to merge different tracklets into long-term trajectories by jointly learning visual feature and spatial-temporal context and designing a bidirectional interpolation to recover the missed objects between matched tracklets. Extensive experiments of public and private detections on four benchmarks demonstrate the robustness of STTA. Furthermore, the proposed method is a model-agnostic method, which can be plugged and played with existing methods to boost their performance, e.g., obtain 11.0%, 10.1%, 2.9%, 3.2%, and 7.8% improvement on IDF1 in the MOT16 validation dataset for Tracktor, CenterTrack, Deepsort, JDE, and CTracker, respectively.<\/jats:p><jats:p\/>","DOI":"10.1145\/3635155","type":"journal-article","created":{"date-parts":[[2023,11,30]],"date-time":"2023-11-30T11:51:37Z","timestamp":1701345097000},"page":"1-21","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":7,"title":["Multi-object Tracking with Spatial-Temporal Tracklet Association"],"prefix":"10.1145","volume":"20","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-2173-1694","authenticated-orcid":false,"given":"Sisi","family":"You","sequence":"first","affiliation":[{"name":"Nanjing University of Posts and Telecommunications; Tianjin University of Technology, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8125-2864","authenticated-orcid":false,"given":"Hantao","family":"Yao","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences (CASIA), China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5956-831X","authenticated-orcid":false,"given":"Bing-Kun","family":"Bao","sequence":"additional","affiliation":[{"name":"Nanjing University of Posts and Telecommunications, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8343-9665","authenticated-orcid":false,"given":"Changsheng","family":"Xu","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences (CASIA); University of Chinese Academy of Sciences, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2024,1,11]]},"reference":[{"key":"e_1_3_1_2_2","doi-asserted-by":"crossref","unstructured":"Na An and Wei Qi Yan. 2021. Multitarget tracking using Siamese neural networks. ACM Transactions on Multimedia Computing Communications and Applications 17 2s (2021) 1\u201316.","DOI":"10.1145\/3441656"},{"key":"e_1_3_1_3_2","article-title":"Multiple people tracking using hierarchical deep tracklet re-identification","author":"Babaee Maryam","year":"2018","unstructured":"Maryam Babaee, Ali Athar, and Gerhard Rigoll. 2018. Multiple people tracking using hierarchical deep tracklet re-identification. arXiv:1811.04091. Retrieved from https:\/\/arixv.org\/abs\/1811.04091","journal-title":"arXiv:1811.04091"},{"key":"e_1_3_1_4_2","first-page":"1218","volume-title":"CVPR","author":"Bae Seung-Hwan","year":"2014","unstructured":"Seung-Hwan Bae and Kuk-Jin Yoon. 2014. Robust online multi-object tracking based on tracklet confidence and online discriminative appearance learning. In CVPR. 1218\u20131225."},{"key":"e_1_3_1_5_2","first-page":"7339","volume-title":"CVPR","author":"Bai Shutao","year":"2022","unstructured":"Shutao Bai, Bingpeng Ma, Hong Chang, Rui Huang, and Xilin Chen. 2022. Salient-to-broad transition for video person re-identification. In CVPR. 7339\u20137348."},{"key":"e_1_3_1_6_2","first-page":"941","volume-title":"ICCV","author":"Bergmann Philipp","year":"2019","unstructured":"Philipp Bergmann, Tim Meinhardt, and Laura Leal-Taixe. 2019. Tracking without bells and whistles. In ICCV. 941\u2013951."},{"key":"e_1_3_1_7_2","doi-asserted-by":"publisher","DOI":"10.1155\/2008\/246309"},{"key":"e_1_3_1_8_2","first-page":"6247","volume-title":"CVPR","author":"Bras\u00f3 Guillem","year":"2020","unstructured":"Guillem Bras\u00f3 and Laura Leal-Taix\u00e9. 2020. Learning a neural solver for multiple object tracking. In CVPR. 6247\u20136257."},{"key":"e_1_3_1_9_2","first-page":"213","volume-title":"European Conference on Computer Vision","author":"Carion Nicolas","year":"2020","unstructured":"Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, and Sergey Zagoruyko. 2020. End-to-end object detection with transformers. In European Conference on Computer Vision. Springer, 213\u2013229."},{"issue":"9","key":"e_1_3_1_10_2","doi-asserted-by":"crossref","first-page":"4192","DOI":"10.1109\/TIP.2019.2908062","article-title":"Spatial-temporal attention-aware learning for video-based person re-identification","volume":"28","author":"Chen Guangyi","year":"2019","unstructured":"Guangyi Chen, Jiwen Lu, Ming Yang, and Jie Zhou. 2019. Spatial-temporal attention-aware learning for video-based person re-identification. IEEE Trans. Image Process. 28, 9 (2019), 4192\u20134205.","journal-title":"IEEE Trans. Image Process."},{"key":"e_1_3_1_11_2","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2019.2940922"},{"key":"e_1_3_1_12_2","article-title":"Segment and track anything","author":"Cheng Yangming","year":"2023","unstructured":"Yangming Cheng, Liulei Li, Yuanyou Xu, Xiaodi Li, Zongxin Yang, Wenguan Wang, and Yi Yang. 2023. Segment and track anything. arXiv:2305.06558. Retrieved from https:\/\/arxiv.org\/abs\/2305.06558","journal-title":"arXiv:2305.06558"},{"key":"e_1_3_1_13_2","first-page":"4836","volume-title":"ICCV","author":"Chu Qi","year":"2017","unstructured":"Qi Chu, Wanli Ouyang, Hongsheng Li, Xiaogang Wang, Bin Liu, and Nenghai Yu. 2017. Online multi-object tracking using CNN-based single object tracker with spatial-temporal attention mechanism. In ICCV. 4836\u20134845."},{"key":"e_1_3_1_14_2","first-page":"2443","volume-title":"CVPR","author":"Dai Peng","year":"2021","unstructured":"Peng Dai, Renliang Weng, Wongun Choi, Changshui Zhang, Zhangping He, and Wei Ding. 2021. Learning a proposal classifier for multiple object tracking. In CVPR. 2443\u20132452."},{"key":"e_1_3_1_15_2","article-title":"Mot20: A benchmark for multi object tracking in crowded scenes","author":"Dendorfer Patrick","year":"2020","unstructured":"Patrick Dendorfer, Hamid Rezatofighi, Anton Milan, Javen Shi, Daniel Cremers, Ian Reid, Stefan Roth, Konrad Schindler, and Laura Leal-Taix\u00e9. 2020. Mot20: A benchmark for multi object tracking in crowded scenes. arXiv:2003.09003. Retrieved from https:\/\/arxiv.org\/abs\/2003.09003","journal-title":"arXiv:2003.09003"},{"key":"e_1_3_1_16_2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2014.2300479"},{"key":"e_1_3_1_17_2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2019.2956703"},{"key":"e_1_3_1_18_2","first-page":"1","volume-title":"ICCV","author":"Ess Andreas","year":"2007","unstructured":"Andreas Ess, Bastian Leibe, and Luc Van Gool. 2007. Depth and appearance for mobile scene analysis. In ICCV. IEEE, 1\u20138."},{"key":"e_1_3_1_19_2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2009.167"},{"key":"e_1_3_1_20_2","first-page":"8287","volume-title":"AAAI","author":"Fu Yang","year":"2019","unstructured":"Yang Fu, Xiaoyang Wang, Yunchao Wei, and Thomas Huang. 2019. Sta: Spatial-temporal attention for large-scale video-based person re-identification. In AAAI, Vol. 33. 8287\u20138294."},{"key":"e_1_3_1_21_2","article-title":"Yolox: Exceeding yolo series in 2021","author":"Ge Zheng","year":"2021","unstructured":"Zheng Ge, Songtao Liu, Feng Wang, Zeming Li, and Jian Sun. 2021. Yolox: Exceeding yolo series in 2021. arXiv:2107.08430. Retrieved from https:\/\/arxiv.org\/abs\/2107.08430","journal-title":"arXiv:2107.08430"},{"key":"e_1_3_1_22_2","first-page":"20052","volume-title":"CVPR","author":"Guo Hongji","year":"2022","unstructured":"Hongji Guo, Hanjing Wang, and Qiang Ji. 2022. Uncertainty-guided probabilistic transformer for complex action recognition. In CVPR. 20052\u201320061."},{"key":"e_1_3_1_23_2","first-page":"8136","volume-title":"CVPR","author":"Guo Song","year":"2021","unstructured":"Song Guo, Jingya Wang, Xinchao Wang, and Dacheng Tao. 2021. Online multiple object tracking with cross-task synergy. In CVPR. 8136\u20138145."},{"key":"e_1_3_1_24_2","first-page":"770","volume-title":"CVPR","author":"He Kaiming","year":"2016","unstructured":"Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2016. Deep residual learning for image recognition. In CVPR. 770\u2013778."},{"key":"e_1_3_1_25_2","article-title":"In defense of the triplet loss for person re-identification","author":"Hermans Alexander","year":"2017","unstructured":"Alexander Hermans, Lucas Beyer, and Bastian Leibe. 2017. In defense of the triplet loss for person re-identification. arXiv:1703.07737. Retrieved from https:\/\/arxiv.org\/abs\/1703.07737","journal-title":"arXiv:1703.07737"},{"key":"e_1_3_1_26_2","first-page":"4364","volume-title":"ICML","author":"Hornakova Andrea","year":"2020","unstructured":"Andrea Hornakova, Roberto Henschel, Bodo Rosenhahn, and Paul Swoboda. 2020. Lifted disjoint paths with application in multiple object tracking. In ICML. PMLR, 4364\u20134375."},{"key":"e_1_3_1_27_2","first-page":"388","volume-title":"ECCV","author":"Hou Ruibing","year":"2020","unstructured":"Ruibing Hou, Hong Chang, Bingpeng Ma, Shiguang Shan, and Xilin Chen. 2020. Temporal complementary learning for video person re-identification. In ECCV. Springer, 388\u2013405."},{"key":"e_1_3_1_28_2","article-title":"Multi-object tracking via end-to-end tracklet searching and ranking","author":"Hu Tao","year":"2020","unstructured":"Tao Hu, Lichao Huang, and Han Shen. 2020. Multi-object tracking via end-to-end tracklet searching and ranking. arXiv:2003.02795. Retrieved from https:\/\/arxiv.org\/abs\/2003.02795","journal-title":"arXiv:2003.02795"},{"key":"e_1_3_1_29_2","article-title":"Adam: A method for stochastic optimization","author":"Kingma Diederik P.","year":"2014","unstructured":"Diederik P. Kingma and Jimmy Ba. 2014. Adam: A method for stochastic optimization. arXiv:1412.6980. Retrieved from https:\/\/arxiv.org\/abs\/1412.6980","journal-title":"arXiv:1412.6980"},{"key":"e_1_3_1_30_2","doi-asserted-by":"crossref","first-page":"29","DOI":"10.1007\/978-3-540-68279-0_2","volume-title":"50 Years of Integer Programming 1958-2008\u2014From the Early Years to the State-of-the-Art","author":"Kuhn Harold W.","year":"2010","unstructured":"Harold W. Kuhn. 2010. The Hungarian method for the assignment problem. In 50 Years of Integer Programming 1958-2008\u2014From the Early Years to the State-of-the-Art. 29\u201347."},{"key":"e_1_3_1_31_2","article-title":"Motchallenge 2015: Towards a benchmark for multi-target tracking","author":"Leal-Taix\u00e9 Laura","year":"2015","unstructured":"Laura Leal-Taix\u00e9, Anton Milan, Ian Reid, Stefan Roth, and Konrad Schindler. 2015. Motchallenge 2015: Towards a benchmark for multi-target tracking. arXiv:1504.01942. Retrieved from https:\/\/arxiv.org\/abs\/1504.01942","journal-title":"arXiv:1504.01942"},{"key":"e_1_3_1_32_2","doi-asserted-by":"publisher","DOI":"10.1145\/3595379"},{"key":"e_1_3_1_33_2","first-page":"369","volume-title":"CVPR","author":"Li Shuang","year":"2018","unstructured":"Shuang Li, Slawomir Bak, Peter Carr, and Xiaogang Wang. 2018. Diversity regularized spatiotemporal attention for video-based person re-identification. In CVPR. 369\u2013378."},{"key":"e_1_3_1_34_2","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2020\/74"},{"key":"e_1_3_1_35_2","first-page":"1","article-title":"HOTA: A higher order metric for evaluating multi-object tracking","author":"Luiten Jonathon","year":"2020","unstructured":"Jonathon Luiten, Aljosa Osep, Patrick Dendorfer, Philip Torr, Andreas Geiger, Laura Leal-Taix\u00e9, and Bastian Leibe. 2020. HOTA: A higher order metric for evaluating multi-object tracking. Int. J. Comput. Vis. (2020), 1\u201331.","journal-title":"Int. J. Comput. Vis."},{"key":"e_1_3_1_36_2","first-page":"1325","volume-title":"CVPR","author":"McLaughlin Niall","year":"2016","unstructured":"Niall McLaughlin, Jesus Martinez Del Rincon, and Paul Miller. 2016. Recurrent convolutional network for video-based person re-identification. In CVPR. 1325\u20131334."},{"key":"e_1_3_1_37_2","article-title":"MOT16: A benchmark for multi-object tracking","author":"Milan Anton","year":"2016","unstructured":"Anton Milan, Laura Leal-Taix\u00e9, Ian Reid, Stefan Roth, and Konrad Schindler. 2016. MOT16: A benchmark for multi-object tracking. arXiv:1603.00831. Retrieved from https:\/\/arxiv.org\/abs\/1603.00831","journal-title":"arXiv:1603.00831"},{"key":"e_1_3_1_38_2","first-page":"6308","volume-title":"CVPR","author":"Pang Bo","year":"2020","unstructured":"Bo Pang, Yizhuo Li, Yifan Zhang, Muchen Li, and Cewu Lu. 2020. Tubetk: Adopting tubes to track multi-object in a one-step training model. In CVPR. 6308\u20136318."},{"key":"e_1_3_1_39_2","first-page":"8024","volume-title":"NeurIPS","author":"Paszke Adam","year":"2019","unstructured":"Adam Paszke, Sam Gross, Francisco Massa, Adam Lerer, James Bradbury, Gregory Chanan, Trevor Killeen, Zeming Lin, Natalia Gimelshein, Luca Antiga, and et al. 2019. PyTorch: An imperative style, high-performance deep learning library. In NeurIPS. 8024\u20138035."},{"key":"e_1_3_1_40_2","first-page":"1","volume-title":"VCIP","author":"Peng Jinlong","year":"2018","unstructured":"Jinlong Peng, Fan Qiu, John See, Qi Guo, Shaoshuai Huang, Ling-Yu Duan, and Weiyao Lin. 2018. Tracklet siamese network with constrained clustering for multiple object tracking. In VCIP. IEEE, 1\u20134."},{"key":"e_1_3_1_41_2","first-page":"145","volume-title":"ECCV","author":"Peng Jinlong","year":"2020","unstructured":"Jinlong Peng, Changan Wang, Fangbin Wan, Yang Wu, Yabiao Wang, Ying Tai, Chengjie Wang, Jilin Li, Feiyue Huang, and Yanwei Fu. 2020. Chained-tracker: Chaining paired attentive regression results for end-to-end joint multiple-object detection and tracking. In ECCV. Springer, 145\u2013161."},{"key":"e_1_3_1_42_2","doi-asserted-by":"crossref","first-page":"107480","DOI":"10.1016\/j.patcog.2020.107480","article-title":"TPM: Multiple object tracking with tracklet-plane matching","author":"Peng Jinlong","year":"2020","unstructured":"Jinlong Peng, Tao Wang, Weiyao Lin, Jian Wang, John See, Shilei Wen, and Erui Ding. 2020. TPM: Multiple object tracking with tracklet-plane matching. Pattern Recogn. (2020), 107480.","journal-title":"Pattern Recogn."},{"issue":"6","key":"e_1_3_1_43_2","doi-asserted-by":"crossref","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","article-title":"Faster R-CNN: Towards real-time object detection with region proposal networks","volume":"39","author":"Ren Shaoqing","year":"2017","unstructured":"Shaoqing Ren, Kaiming He, Ross B. Girshick, and Jian Sun. 2017. Faster R-CNN: Towards real-time object detection with region proposal networks. Trans. Pattern Anal. Mach. Intell. 39, 6 (2017), 1137\u20131149.","journal-title":"Trans. Pattern Anal. Mach. Intell."},{"key":"e_1_3_1_44_2","first-page":"17","volume-title":"ECCV Workshops","author":"Ristani Ergys","year":"2016","unstructured":"Ergys Ristani, Francesco Solera, Roger S. Zou, Rita Cucchiara, and Carlo Tomasi. 2016. Performance measures and a data set for multi-target, multi-camera tracking. In ECCV Workshops. 17\u201335."},{"key":"e_1_3_1_45_2","first-page":"14329","volume-title":"CVPR","author":"Saleh Fatemeh","year":"2021","unstructured":"Fatemeh Saleh, Sadegh Aliakbarian, Hamid Rezatofighi, Mathieu Salzmann, and Stephen Gould. 2021. Probabilistic tracklet scoring and inpainting for multiple object tracking. In CVPR. 14329\u201314339."},{"key":"e_1_3_1_46_2","article-title":"Tracklet association tracker: An end-to-end learning-based association approach for multi-object tracking","author":"Shen Han","year":"2018","unstructured":"Han Shen, Lichao Huang, Chang Huang, and Wei Xu. 2018. Tracklet association tracker: An end-to-end learning-based association approach for multi-object tracking. arXiv:1808.01562. Retrieved from https:\/\/arxiv.org\/abs\/1808.01562","journal-title":"arXiv:1808.01562"},{"key":"e_1_3_1_47_2","first-page":"10958","volume-title":"CVPR","author":"Stadler Daniel","year":"2021","unstructured":"Daniel Stadler and Jurgen Beyerer. 2021. Improving multiple pedestrian tracking by track management and occlusion handling. In CVPR. 10958\u201310967."},{"key":"e_1_3_1_48_2","first-page":"133","volume-title":"WACV","author":"Stadler Daniel","year":"2022","unstructured":"Daniel Stadler and J\u00fcrgen Beyerer. 2022. Modelling ambiguous assignments for multi-person tracking in crowds. In WACV. 133\u2013142."},{"key":"e_1_3_1_49_2","first-page":"562","volume-title":"ICCV","author":"Subramaniam Arulkumar","year":"2019","unstructured":"Arulkumar Subramaniam, Athira Nambiar, and Anurag Mittal. 2019. Co-segmentation inspired attention networks for video-based person re-identification. In ICCV. 562\u2013572."},{"key":"e_1_3_1_50_2","article-title":"Transtrack: Multiple object tracking with transformer","author":"Sun Peize","year":"2020","unstructured":"Peize Sun, Jinkun Cao, Yi Jiang, Rufeng Zhang, Enze Xie, Zehuan Yuan, Changhu Wang, and Ping Luo. 2020. Transtrack: Multiple object tracking with transformer. arXiv:2012.15460. Retrieved from https:\/\/arxiv.org\/abs\/2012.15460","journal-title":"arXiv:2012.15460"},{"key":"e_1_3_1_51_2","first-page":"10860","volume-title":"ICCV","author":"Tokmakov Pavel","year":"2021","unstructured":"Pavel Tokmakov, Jie Li, Wolfram Burgard, and Adrien Gaidon. 2021. Learning to track with object permanence. In ICCV. 10860\u201310869."},{"key":"e_1_3_1_52_2","first-page":"2211","volume-title":"CVPR","author":"Tseng Albert","year":"2022","unstructured":"Albert Tseng, Jennifer J. Sun, and Yisong Yue. 2022. Automatic synthesis of diverse weak supervision sources for behavior analysis. In CVPR. 2211\u20132220."},{"key":"e_1_3_1_53_2","first-page":"9876","volume-title":"ICCV","author":"Wang Gaoang","year":"2021","unstructured":"Gaoang Wang, Renshu Gu, Zuozhu Liu, Weijie Hu, Mingli Song, and Jenq-Neng Hwang. 2021. Track without appearance: Learn box and tracklet embedding with local and global motion patterns for vehicle tracking. In ICCV. 9876\u20139886."},{"key":"e_1_3_1_54_2","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3140919"},{"key":"e_1_3_1_55_2","first-page":"482","volume-title":"ACM MM","author":"Wang Gaoang","year":"2019","unstructured":"Gaoang Wang, Yizhou Wang, Haotian Zhang, Renshu Gu, and Jenq-Neng Hwang. 2019. Exploit the connectivity: Multi-object tracking with trackletnet. In ACM MM. 482\u2013490."},{"key":"e_1_3_1_56_2","doi-asserted-by":"crossref","unstructured":"Haidong Wang Xuan He Zhiyong Li Jin Yuan and Shutao Li. 2023. JDAN: Joint detection and association network for real-time online multi-object tracking. ACM Trans. Multimedia Comput. Commun. Appl. 19 1s (2023) 1\u201317.","DOI":"10.1145\/3533253"},{"key":"e_1_3_1_57_2","first-page":"3876","volume-title":"CVPR","author":"Wang Qiang","year":"2021","unstructured":"Qiang Wang, Yun Zheng, Pan Pan, and Yinghui Xu. 2021. Multiple object tracking with correlation learning. In CVPR. 3876\u20133886."},{"key":"e_1_3_1_58_2","first-page":"13219","volume-title":"ICCV","author":"Wang Shuai","year":"2021","unstructured":"Shuai Wang, Hao Sheng, Yang Zhang, Yubin Wu, and Zhang Xiong. 2021. A general recurrent tracking framework without real data. In ICCV. 13219\u201313228."},{"key":"e_1_3_1_59_2","first-page":"7794","volume-title":"CVPR","author":"Wang Xiaolong","year":"2018","unstructured":"Xiaolong Wang, Ross Girshick, Abhinav Gupta, and Kaiming He. 2018. Non-local neural networks. In CVPR. 7794\u20137803."},{"key":"e_1_3_1_60_2","first-page":"13708","volume-title":"ICRA","author":"Wang Yongxin","year":"2021","unstructured":"Yongxin Wang, Kris Kitani, and Xinshuo Weng. 2021. Joint object detection and multi-object tracking with graph neural networks. In ICRA. 13708\u201313715."},{"key":"e_1_3_1_61_2","first-page":"13096","volume-title":"CVPR","author":"Wang Zitian","year":"2022","unstructured":"Zitian Wang, Xuecheng Nie, Xiaochao Qu, Yunpeng Chen, and Si Liu. 2022. Distribution-aware single-stage models for multi-person 3D pose estimation. In CVPR. 13096\u201313105."},{"key":"e_1_3_1_62_2","first-page":"107","volume-title":"ECCV","author":"Wang Zhongdao","year":"2020","unstructured":"Zhongdao Wang, Liang Zheng, Yixuan Liu, and Shengjin Wang. 2020. Towards real-time multi-object tracking. In ECCV. Springer, 107\u2013122."},{"key":"e_1_3_1_63_2","first-page":"3645","volume-title":"ICIP","author":"Wojke Nicolai","year":"2017","unstructured":"Nicolai Wojke, Alex Bewley, and Dietrich Paulus. 2017. Simple online and realtime tracking with a deep association metric. In ICIP. 3645\u20133649."},{"key":"e_1_3_1_64_2","first-page":"7319","volume-title":"CVPR","author":"Wu Wei","year":"2022","unstructured":"Wei Wu, Jiawei Liu, Kecheng Zheng, Qibin Sun, and Zheng-Jun Zha. 2022. Temporal complementarity-guided reinforcement learning for image-to-video person re-identification. In CVPR. 7319\u20137328."},{"issue":"1","key":"e_1_3_1_65_2","doi-asserted-by":"crossref","first-page":"275","DOI":"10.1109\/TCSVT.2020.2975842","article-title":"End-to-end learning deep CRF models for multi-object tracking deep CRF models","volume":"31","author":"Xiang Jun","year":"2020","unstructured":"Jun Xiang, Guohan Xu, Chao Ma, and Jianhua Hou. 2020. End-to-end learning deep CRF models for multi-object tracking deep CRF models. Trans. Circ. Syst. Vid. Technol 31, 1 (2020), 275\u2013288.","journal-title":"Trans. Circ. Syst. Vid. Technol"},{"key":"e_1_3_1_66_2","first-page":"3988","volume-title":"ICCV","author":"Xu Jiarui","year":"2019","unstructured":"Jiarui Xu, Yue Cao, Zheng Zhang, and Han Hu. 2019. Spatial-temporal relation networks for multi-object tracking. In ICCV. 3988\u20133998."},{"issue":"6","key":"e_1_3_1_67_2","first-page":"7820","article-title":"TransCenter: Transformers with dense representations for multiple-object tracking","volume":"45","author":"Xu Yihong","year":"2022","unstructured":"Yihong Xu, Yutong Ban, Guillaume Delorme, Chuang Gan, Daniela Rus, and Xavier Alameda-Pineda. 2022. TransCenter: Transformers with dense representations for multiple-object tracking. IEEE Trans. Pattern Anal. Mach. Intell. 45, 6 (2022), 7820\u20137835.","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"e_1_3_1_68_2","doi-asserted-by":"crossref","first-page":"104091","DOI":"10.1016\/j.imavis.2020.104091","article-title":"ReMOT: A model-agnostic refinement for multiple object tracking","volume":"106","author":"Yang Fan","year":"2021","unstructured":"Fan Yang, Xin Chang, Sakriani Sakti, Yang Wu, and Satoshi Nakamura. 2021. ReMOT: A model-agnostic refinement for multiple object tracking. Image Vis. Comput. 106 (2021), 104091.","journal-title":"Image Vis. Comput."},{"key":"e_1_3_1_69_2","first-page":"6768","volume-title":"CVPR","author":"Yin Junbo","year":"2020","unstructured":"Junbo Yin, Wenguan Wang, Qinghao Meng, Ruigang Yang, and Jianbing Shen. 2020. A unified object motion and affinity model for online multi-object tracking. In CVPR. 6768\u20136777."},{"key":"e_1_3_1_70_2","first-page":"1","volume-title":"CVPR","author":"Yu Qian","year":"2007","unstructured":"Qian Yu, G\u00e9rard Medioni, and Isaac Cohen. 2007. Multiple target tracking using spatio-temporal markov chain monte carlo data association. In CVPR. IEEE, 1\u20138."},{"key":"e_1_3_1_71_2","first-page":"659","volume-title":"European Conference on Computer Vision","author":"Zeng Fangao","year":"2022","unstructured":"Fangao Zeng, Bin Dong, Yuang Zhang, Tiancai Wang, Xiangyu Zhang, and Yichen Wei. 2022. Motr: End-to-end multiple-object tracking with transformer. In European Conference on Computer Vision. Springer, 659\u2013675."},{"issue":"4","key":"e_1_3_1_72_2","doi-asserted-by":"crossref","first-page":"1460","DOI":"10.1109\/TPAMI.2020.2976969","article-title":"Ordered or orderless: A revisit for video based person re-identification","volume":"43","author":"Zhang Le","year":"2020","unstructured":"Le Zhang, Zenglin Shi, Joey Tianyi Zhou, Ming-Ming Cheng, Yun Liu, Jia-Wang Bian, Zeng Zeng, and Chunhua Shen. 2020. Ordered or orderless: A revisit for video based person re-identification. Trans. Pattern Anal. Mach. Intell. 43, 4 (2020), 1460\u20131466.","journal-title":"Trans. Pattern Anal. Mach. Intell."},{"key":"e_1_3_1_73_2","first-page":"3365","article-title":"A multi-scale spatial-temporal attention model for person re-identification in videos","volume":"29","author":"Zhang Wei","year":"2019","unstructured":"Wei Zhang, Xuanyu He, Xiaodong Yu, Weizhi Lu, Zhengjun Zha, and Qi Tian. 2019. A multi-scale spatial-temporal attention model for person re-identification in videos. TIP 29 (2019), 3365\u20133373.","journal-title":"TIP"},{"key":"e_1_3_1_74_2","doi-asserted-by":"crossref","first-page":"6694","DOI":"10.1109\/TIP.2020.2993073","article-title":"Long-term tracking with deep tracklet association","volume":"29","author":"Zhang Yang","year":"2020","unstructured":"Yang Zhang, Hao Sheng, Yubin Wu, Shuai Wang, Weifeng Lyu, Wei Ke, and Zhang Xiong. 2020. Long-term tracking with deep tracklet association. Trans. Image Process. 29 (2020), 6694\u20136706.","journal-title":"Trans. Image Process."},{"key":"e_1_3_1_75_2","first-page":"1","volume-title":"ECCV","author":"Zhang Yifu","year":"2022","unstructured":"Yifu Zhang, Peize Sun, Yi Jiang, Dongdong Yu, Fucheng Weng, Zehuan Yuan, Ping Luo, Wenyu Liu, and Xinggang Wang. 2022. Bytetrack: Multi-object tracking by associating every detection box. In ECCV. Springer, 1\u201321."},{"key":"e_1_3_1_76_2","first-page":"1","article-title":"Fairmot: On the fairness of detection and re-identification in multiple object tracking","author":"Zhang Yifu","year":"2021","unstructured":"Yifu Zhang, Chunyu Wang, Xinggang Wang, Wenjun Zeng, and Wenyu Liu. 2021. Fairmot: On the fairness of detection and re-identification in multiple object tracking. Int. J. Comput. Vis. (2021), 1\u201319.","journal-title":"Int. J. Comput. Vis."},{"key":"e_1_3_1_77_2","first-page":"4913","volume-title":"CVPR","author":"Zhao Yiru","year":"2019","unstructured":"Yiru Zhao, Xu Shen, Zhongming Jin, Hongtao Lu, and Xian-sheng Hua. 2019. Attribute-driven feature disentangling and temporal aggregation for video person re-identification. In CVPR. 4913\u20134922."},{"key":"e_1_3_1_78_2","first-page":"474","volume-title":"ECCV","author":"Zhou Xingyi","year":"2020","unstructured":"Xingyi Zhou, Vladlen Koltun, and Philipp Kr\u00e4henb\u00fchl. 2020. Tracking objects as points. In ECCV. Springer, 474\u2013490."},{"key":"e_1_3_1_79_2","first-page":"8771","volume-title":"CVPR","author":"Zhou Xingyi","year":"2022","unstructured":"Xingyi Zhou, Tianwei Yin, Vladlen Koltun, and Philipp Kr\u00e4henb\u00fchl. 2022. Global tracking transformers. In CVPR. 8771\u20138780."},{"key":"e_1_3_1_80_2","doi-asserted-by":"crossref","unstructured":"Tianyu Zhu Markus Hiller Mahsa Ehsanpour Rongkai Ma Tom Drummond Ian Reid and Hamid Rezatofighi. 2022. Looking beyond two frames: End-to-end multi-object tracking using spatial and temporal transformers. IEEE Trans. Pattern Anal. Mach. Intell. 45 11 (2023) 12783\u201312797.","DOI":"10.1109\/TPAMI.2022.3213073"}],"container-title":["ACM Transactions on Multimedia Computing, Communications, and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3635155","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3635155","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,18]],"date-time":"2025-06-18T22:49:06Z","timestamp":1750286946000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3635155"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,1,11]]},"references-count":79,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2024,5,31]]}},"alternative-id":["10.1145\/3635155"],"URL":"https:\/\/doi.org\/10.1145\/3635155","relation":{},"ISSN":["1551-6857","1551-6865"],"issn-type":[{"value":"1551-6857","type":"print"},{"value":"1551-6865","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,1,11]]},"assertion":[{"value":"2023-05-25","order":0,"name":"received","label":"Received","group":{"name":"publication_history","label":"Publication History"}},{"value":"2023-11-24","order":1,"name":"accepted","label":"Accepted","group":{"name":"publication_history","label":"Publication History"}},{"value":"2024-01-11","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}