{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,4]],"date-time":"2026-04-04T18:06:55Z","timestamp":1775326015796,"version":"3.50.1"},"publisher-location":"Cham","reference-count":81,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031726903","type":"print"},{"value":"9783031726910","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,3]],"date-time":"2024-11-03T00:00:00Z","timestamp":1730592000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,3]],"date-time":"2024-11-03T00:00:00Z","timestamp":1730592000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-72691-0_27","type":"book-chapter","created":{"date-parts":[[2024,11,2]],"date-time":"2024-11-02T18:05:07Z","timestamp":1730570707000},"page":"486-504","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["SemTrack: A Large-Scale Dataset for\u00a0Semantic Tracking in\u00a0the\u00a0Wild"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0567-8406","authenticated-orcid":false,"given":"Pengfei","family":"Wang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9258-5768","authenticated-orcid":false,"given":"Xiaofei","family":"Hui","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-0942-5418","authenticated-orcid":false,"given":"Jing","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-8624-428X","authenticated-orcid":false,"given":"Zile","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9760-4833","authenticated-orcid":false,"given":"Kian Eng","family":"Ong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-3228-3517","authenticated-orcid":false,"given":"Xinge","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3113-9131","authenticated-orcid":false,"given":"Beijia","family":"Lu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dezhao","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1763-3106","authenticated-orcid":false,"given":"Evan","family":"Ling","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6969-2696","authenticated-orcid":false,"given":"Weiling","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Keng Teck","family":"Ma","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Minhoe","family":"Hur","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4365-4165","authenticated-orcid":false,"given":"Jun","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,11,3]]},"reference":[{"key":"27_CR1","unstructured":"Cambridge dictionary. https:\/\/dictionary.cambridge.org\/dictionary\/english\/track"},{"key":"27_CR2","unstructured":"Collins dictionary. https:\/\/www.collinsdictionary.com\/dictionary\/english\/track"},{"key":"27_CR3","unstructured":"Oxford learner\u2019s dictionary. https:\/\/www.oxfordlearnersdictionaries.com\/definition\/american_english\/track_2"},{"issue":"2","key":"27_CR4","doi-asserted-by":"publisher","first-page":"174","DOI":"10.1109\/78.978374","volume":"50","author":"MS Arulampalam","year":"2002","unstructured":"Arulampalam, M.S., Maskell, S., Gordon, N., Clapp, T.: A tutorial on particle filters for online nonlinear\/non-gaussian bayesian tracking. IEEE Trans. Signal Process. 50(2), 174\u2013188 (2002)","journal-title":"IEEE Trans. Signal Process."},{"key":"27_CR5","doi-asserted-by":"publisher","unstructured":"Bewley, A., Ge, Z., Ott, L., Ramos, F., Upcroft, B.: Simple online and realtime tracking. In: 2016 IEEE International Conference on Image Processing (ICIP), pp. 3464\u20133468 (2016). https:\/\/doi.org\/10.1109\/ICIP.2016.7533003","DOI":"10.1109\/ICIP.2016.7533003"},{"key":"27_CR6","doi-asserted-by":"crossref","unstructured":"Bhatnagar, B.L., Xie, X., Petrov, I., Sminchisescu, C., Theobalt, C., Pons-Moll, G.: Behave: dataset and method for tracking human object interactions. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), IEEE, June 2022","DOI":"10.1109\/CVPR52688.2022.01547"},{"key":"27_CR7","doi-asserted-by":"publisher","unstructured":"Bickel, S., Br\u00fcckner, M., Scheffer, T.: Discriminative learning for differing training and test distributions. In: Proceedings of the 24th International Conference on Machine Learning, p.p 81\u201388. ICML 2007, Association for Computing Machinery, New York, NY, USA (2007). https:\/\/doi.org\/10.1145\/1273496.1273507","DOI":"10.1145\/1273496.1273507"},{"key":"27_CR8","unstructured":"Bochkovskiy, A., Wang, C.Y., Liao, H.Y.M.: Yolov4: optimal speed and accuracy of object detection. arXiv preprint arXiv:2004.10934 (2020)"},{"key":"27_CR9","doi-asserted-by":"publisher","first-page":"4504111","DOI":"10.1109\/TGRS.2024.3373442","volume":"62","author":"Y Dai","year":"2024","unstructured":"Dai, Y., Ma, F., Hu, W., Zhang, F.: SPGC: shape-prior based generated content data augmentation for remote sensing object detection. IEEE Trans. Geosci. Remote Sens. 62, 4504111 (2024)","journal-title":"IEEE Trans. Geosci. Remote Sens."},{"key":"27_CR10","doi-asserted-by":"publisher","unstructured":"Dave, A., Khurana, T., Tokmakov, P., Schmid, C., Ramanan, D.: TAO: a large-scale benchmark for tracking any object, pp. 436\u2013454, October 2020. https:\/\/doi.org\/10.1007\/978-3-030-58558-7_26","DOI":"10.1007\/978-3-030-58558-7_26"},{"key":"27_CR11","doi-asserted-by":"publisher","first-page":"845","DOI":"10.1007\/s11263-020-01393-0","volume":"129","author":"P Dendorfer","year":"2021","unstructured":"Dendorfer, P., Osep, A., Milan, A., Schindler, K., Cremers, D., Reid, I., Roth, S., Leal-Taix\u00e9, L.: Motchallenge: a benchmark for single-camera multiple target tracking. Int. J. Comput. Vision 129, 845\u2013881 (2021). https:\/\/doi.org\/10.1007\/s11263-020-01393-0","journal-title":"Int. J. Comput. Vision"},{"key":"27_CR12","unstructured":"Dendorfer, P., et al.: Mot20: a benchmark for multi object tracking in crowded scenes. arXiv preprint arXiv:2003.09003 (2020)"},{"key":"27_CR13","doi-asserted-by":"crossref","unstructured":"Doering, A., Chen, D., Zhang, S., Schiele, B., Gall, J.: Posetrack21: a dataset for person search, multi-object tracking and multi-person pose tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 20963\u201320972 (2022)","DOI":"10.1109\/CVPR52688.2022.02029"},{"key":"27_CR14","doi-asserted-by":"crossref","unstructured":"Fan, H., et al.: LaSOT: a high-quality benchmark for large-scale single object tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5374\u20135383 (2019)","DOI":"10.1109\/CVPR.2019.00552"},{"key":"27_CR15","doi-asserted-by":"publisher","unstructured":"Feng, Q., Ablavsky, V., Bai, Q., Li, G., Sclaroff, S.: Real-time visual object tracking with natural language description, pp. 689\u2013698, March 2020. https:\/\/doi.org\/10.1109\/WACV45572.2020.9093425","DOI":"10.1109\/WACV45572.2020.9093425"},{"key":"27_CR16","doi-asserted-by":"crossref","unstructured":"Feng, Q., Ablavsky, V., Bai, Q., Sclaroff, S.: Siamese natural language tracker: tracking by natural language descriptions with siamese trackers. In: Proc. IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2021)","DOI":"10.1109\/CVPR46437.2021.00579"},{"key":"27_CR17","unstructured":"Feng, Q., Ablavsky, V., Sclaroff, S.: CityFlow-NL: tracking and retrieval of vehicles at city scale by natural language descriptions. arXiv preprint arXiv:2101.04741 (2021)"},{"key":"27_CR18","unstructured":"Fischer, T., et al.: Qdtrack: quasi-dense similarity learning for appearance-only multiple object tracking. arXiv preprint arXiv:2210.06984 (2022)"},{"key":"27_CR19","unstructured":"Ge, Z., Liu, S., Wang, F., Li, Z., Sun, J.: Yolox: exceeding yolo series in 2021. arXiv preprint arXiv:2107.08430 (2021)"},{"key":"27_CR20","doi-asserted-by":"crossref","unstructured":"Geiger, A., Lenz, P., Urtasun, R.: Are we ready for autonomous driving? the kitti vision benchmark suite. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2012)","DOI":"10.1109\/CVPR.2012.6248074"},{"key":"27_CR21","doi-asserted-by":"publisher","unstructured":"Gu, C., et al.: Ava: a video dataset of spatio-temporally localized atomic visual actions. In: 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 6047\u20136056 (2018). https:\/\/doi.org\/10.1109\/CVPR.2018.00633","DOI":"10.1109\/CVPR.2018.00633"},{"key":"27_CR22","doi-asserted-by":"crossref","unstructured":"Guo, J., Zhu, X., Zhao, C., Cao, D., Lei, Z., Li, S.Z.: Learning meta face recognition in unseen domains. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 6163\u20136172 (2020)","DOI":"10.1109\/CVPR42600.2020.00620"},{"key":"27_CR23","unstructured":"Guo, M., Zhang, Z., Fan, H., Jing, L.: Divert more attention to vision-language tracking. arXiv preprint arXiv:2207.01076 (2022)"},{"issue":"9","key":"27_CR24","doi-asserted-by":"publisher","first-page":"1263","DOI":"10.1109\/TKDE.2008.239","volume":"21","author":"H He","year":"2009","unstructured":"He, H., Garcia, E.A.: Learning from imbalanced data. IEEE Trans. Knowl. Data Eng. 21(9), 1263\u20131284 (2009)","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"27_CR25","doi-asserted-by":"crossref","unstructured":"He, K., Gkioxari, G., Doll\u00e1r, P., Girshick, R.: Mask r-cnn. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2961\u20132969 (2017)","DOI":"10.1109\/ICCV.2017.322"},{"key":"27_CR26","doi-asserted-by":"publisher","first-page":"1562","DOI":"10.1109\/TPAMI.2019.2957464","volume":"43","author":"L Huang","year":"2019","unstructured":"Huang, L., Zhao, X., Huang, K.: Got-10k: a large high-diversity benchmark for generic object tracking in the wild. IEEE Trans. Pattern Anal. Mach. Intell. 43, 1562\u20131577 (2019)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"1","key":"27_CR27","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/s40537-019-0192-5","volume":"6","author":"JM Johnson","year":"2019","unstructured":"Johnson, J.M., Khoshgoftaar, T.M.: Survey on deep learning with class imbalance. J. Big Data 6(1), 1\u201354 (2019)","journal-title":"J. Big Data"},{"key":"27_CR28","doi-asserted-by":"publisher","unstructured":"Karbalaie, A., Abtahi, F., Sj\u00f6str\u00f6m, M.: Event detection in surveillance videos: a review. Multimedia Tools Appl. 81, 1\u201339 (2022). https:\/\/doi.org\/10.1007\/s11042-021-11864-2","DOI":"10.1007\/s11042-021-11864-2"},{"key":"27_CR29","unstructured":"Kenton, J.D.M.W.C., Toutanova, L.K.: Bert: pre-training of deep bidirectional transformers for language understanding. In: Proceedings of naacL-HLT, pp. 4171\u20134186 (2019)"},{"key":"27_CR30","doi-asserted-by":"crossref","unstructured":"Kiani\u00a0Galoogahi, H., Fagg, A., Huang, C., Ramanan, D., Lucey, S.: Need for speed: a benchmark for higher frame rate object tracking. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 1125\u20131134 (2017)","DOI":"10.1109\/ICCV.2017.128"},{"key":"27_CR31","doi-asserted-by":"publisher","unstructured":"Kristan, M., et. al.: The seventh visual object tracking vot2019 challenge results. In: 2019 IEEE\/CVF International Conference on Computer Vision Workshop (ICCVW), pp. 2206\u20132241 (2019). https:\/\/doi.org\/10.1109\/ICCVW.2019.00276","DOI":"10.1109\/ICCVW.2019.00276"},{"issue":"11","key":"27_CR32","doi-asserted-by":"publisher","first-page":"2137","DOI":"10.1109\/TPAMI.2016.2516982","volume":"38","author":"M Kristan","year":"2016","unstructured":"Kristan, M., et al.: A novel performance evaluation methodology for single-target trackers. IEEE Trans. Pattern Anal. Mach. Intell. 38(11), 2137\u20132155 (2016). https:\/\/doi.org\/10.1109\/TPAMI.2016.2516982","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"27_CR33","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"191","DOI":"10.1007\/978-3-319-16181-5_14","volume-title":"Computer Vision - ECCV 2014 Workshops","author":"M Kristan","year":"2015","unstructured":"Kristan, M., et al.: The visual object tracking VOT2014 challenge results. In: Agapito, L., Bronstein, M.M., Rother, C. (eds.) ECCV 2014. LNCS, vol. 8926, pp. 191\u2013217. Springer, Cham (2015). https:\/\/doi.org\/10.1007\/978-3-319-16181-5_14"},{"issue":"1\u20132","key":"27_CR34","doi-asserted-by":"publisher","first-page":"83","DOI":"10.1002\/nav.3800020109","volume":"2","author":"HW Kuhn","year":"1955","unstructured":"Kuhn, H.W.: The hungarian method for the assignment problem. Naval Res. Logist. Quart. 2(1\u20132), 83\u201397 (1955)","journal-title":"Naval Res. Logist. Quart."},{"key":"27_CR35","unstructured":"Leal-Taix\u00e9, L., Milan, A., Reid, I., Roth, S., Schindler, K.: Motchallenge 2015: towards a benchmark for multi-target tracking. arXiv preprint arXiv:1504.01942 (2015)"},{"issue":"2","key":"27_CR36","doi-asserted-by":"publisher","first-page":"335","DOI":"10.1109\/TPAMI.2015.2417577","volume":"38","author":"A Li","year":"2016","unstructured":"Li, A., Lin, M., Wu, Y., Yang, M., Yan, S.: NUS-PRO: a new visual tracking challenge. IEEE Trans. Pattern Anal. Mach. Intell. 38(2), 335\u2013349 (2016)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"27_CR37","unstructured":"Li, C., et\u00a0al.: Yolov6: a single-stage object detection framework for industrial applications. arXiv preprint arXiv:2209.02976 (2022)"},{"key":"27_CR38","doi-asserted-by":"crossref","unstructured":"Li, D., Yang, Y., Song, Y.Z., Hospedales, T.: Learning to generalize: meta-learning for domain generalization. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.\u00a032 (2018)","DOI":"10.1609\/aaai.v32i1.11596"},{"key":"27_CR39","doi-asserted-by":"crossref","unstructured":"Li, M., Cheung, Y.M., Lu, Y.: Long-tailed visual recognition via gaussian clouded logit adjustment. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 6929\u20136938 (2022)","DOI":"10.36227\/techrxiv.17031920.v1"},{"key":"27_CR40","doi-asserted-by":"crossref","unstructured":"Li, Y., Yu, J., Cai, Z., Pan, Y.: Cross-modal target retrieval for tracking by natural language. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4931\u20134940 (2022)","DOI":"10.1109\/CVPRW56347.2022.00540"},{"key":"27_CR41","doi-asserted-by":"crossref","unstructured":"Li, Z., Tao, R., Gavves, E., Snoek, C.G., Smeulders, A.W.: Tracking by natural language specification. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6495\u20136503 (2017)","DOI":"10.1109\/CVPR.2017.777"},{"issue":"12","key":"27_CR42","doi-asserted-by":"publisher","first-page":"5630","DOI":"10.1109\/TIP.2015.2482905","volume":"24","author":"P Liang","year":"2015","unstructured":"Liang, P., Blasch, E., Ling, H.: Encoding color information for visual tracking: Algorithms and benchmark. IEEE Trans. Image Process. 24(12), 5630\u20135644 (2015)","journal-title":"IEEE Trans. Image Process."},{"key":"27_CR43","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"12","DOI":"10.1007\/978-3-319-56687-0_2","volume-title":"Video Analytics. Face and Facial Expression Recognition and Audience Measurement","author":"D Liciotti","year":"2017","unstructured":"Liciotti, D., Frontoni, E., Mancini, A., Zingaretti, P.: Pervasive system for consumer behaviour analysis in retail environments. In: Nasrollahi, K., Distante, C., Hua, G., Cavallaro, A., Moeslund, T.B., Battiato, S., Ji, Q. (eds.) FFER\/VAAM -2016. LNCS, vol. 10165, pp. 12\u201323. Springer, Cham (2017). https:\/\/doi.org\/10.1007\/978-3-319-56687-0_2"},{"key":"27_CR44","doi-asserted-by":"publisher","unstructured":"Lin, T.Y., Doll\u00e1r, P., Girshick, R., He, K., Hariharan, B., Belongie, S.: Feature pyramid networks for object detection. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 936\u2013944 (2017). https:\/\/doi.org\/10.1109\/CVPR.2017.106","DOI":"10.1109\/CVPR.2017.106"},{"key":"27_CR45","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Goyal, P., Girshick, R., He, K., Doll\u00e1r, P.: Focal loss for dense object detection. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2980\u20132988 (2017)","DOI":"10.1109\/ICCV.2017.324"},{"key":"27_CR46","doi-asserted-by":"publisher","first-page":"548","DOI":"10.1007\/s11263-020-01375-2","volume":"129","author":"J Luiten","year":"2021","unstructured":"Luiten, J., et al.: Hota: a higher order metric for evaluating multi-object tracking. Int. J. Comput. Vision 129, 548\u2013578 (2021)","journal-title":"Int. J. Comput. Vision"},{"key":"27_CR47","doi-asserted-by":"publisher","first-page":"103448","DOI":"10.1016\/j.artint.2020.103448","volume":"293","author":"W Luo","year":"2021","unstructured":"Luo, W., Xing, J., Milan, A., Zhang, X., Liu, W., Kim, T.K.: Multiple object tracking: a literature review. Artif. Intell. 293, 103448 (2021)","journal-title":"Artif. Intell."},{"key":"27_CR48","doi-asserted-by":"crossref","unstructured":"Meinhardt, T., Kirillov, A., Leal-Taixe, L., Feichtenhofer, C.: Trackformer: multi-object tracking with transformers. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 8844\u20138854 (2022)","DOI":"10.1109\/CVPR52688.2022.00864"},{"key":"27_CR49","unstructured":"Milan, A., Leal-Taix\u00e9, L., Reid, I., Roth, S., Schindler, K.: Mot16: a benchmark for multi-object tracking. arXiv preprint arXiv:1603.00831 (2016)"},{"key":"27_CR50","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"445","DOI":"10.1007\/978-3-319-46448-0_27","volume-title":"Computer Vision \u2013 ECCV 2016","author":"M Mueller","year":"2016","unstructured":"Mueller, M., Smith, N., Ghanem, B.: A benchmark and simulator for UAV tracking. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9905, pp. 445\u2013461. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46448-0_27"},{"key":"27_CR51","doi-asserted-by":"crossref","unstructured":"Muller, M., Bibi, A., Giancola, S., Alsubaihi, S., Ghanem, B.: TrackingNet: a large-scale dataset and benchmark for object tracking in the wild. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 300\u2013317 (2018)","DOI":"10.1007\/978-3-030-01246-5_19"},{"key":"27_CR52","doi-asserted-by":"publisher","unstructured":"Qu, H., Li, Y., Foo, L.G., Kuen, J., Gu, J., Liu, J.: Improving the reliability for confidence estimation. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision - ECCV 2022. ECCV 2022. Lecture Notes in Computer Science, vol. 13687, pp. 391\u2013408. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19812-0_23","DOI":"10.1007\/978-3-031-19812-0_23"},{"key":"27_CR53","doi-asserted-by":"publisher","first-page":"116300","DOI":"10.1016\/j.eswa.2021.116300","volume":"192","author":"L Rakai","year":"2022","unstructured":"Rakai, L., Song, H., Sun, S., Zhang, W., Yang, Y.: Data association in multiple object tracking: a survey of recent techniques. Expert Syst. Appl. 192, 116300 (2022)","journal-title":"Expert Syst. Appl."},{"key":"27_CR54","unstructured":"Redmon, J., Farhadi, A.: Yolov3: an incremental improvement. arXiv preprint arXiv:1804.02767 (2018)"},{"key":"27_CR55","unstructured":"Ren, S., He, K., Girshick, R., Sun, J.: Faster r-cnn: towards real-time object detection with region proposal networks. In: Advances in Neural Information Processing Systems, vol. 28 (2015)"},{"issue":"3","key":"27_CR56","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., et al.: ImageNet large scale visual recognition challenge. Int. J. Comput. Vis. (IJCV) 115(3), 211\u2013252 (2015). https:\/\/doi.org\/10.1007\/s11263-015-0816-y","journal-title":"Int. J. Comput. Vis. (IJCV)"},{"key":"27_CR57","doi-asserted-by":"crossref","unstructured":"Shang, X., Di, D., Xiao, J., Cao, Y., Yang, X., Chua, T.S.: Annotating objects and relations in user-generated videos. In: Proceedings of the 2019 on International Conference on Multimedia Retrieval, pp. 279\u2013287. ACM (2019)","DOI":"10.1145\/3323873.3325056"},{"key":"27_CR58","doi-asserted-by":"crossref","unstructured":"Shang, X., Ren, T., Guo, J., Zhang, H., Chua, T.S.: Video visual relation detection. In: ACM International Conference on Multimedia, Mountain View, CA USA, October 2017","DOI":"10.1145\/3123266.3123380"},{"key":"27_CR59","unstructured":"Soleimanitaleb, Z., Keyvanrad, M.A.: Single object tracking: a survey of methods, datasets, and evaluation metrics. arXiv preprint arXiv:2201.13066 (2022)"},{"key":"27_CR60","doi-asserted-by":"crossref","unstructured":"Sun, P., et\u00a0al.: Scalability in perception for autonomous driving: Waymo open dataset. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2446\u20132454 (2020)","DOI":"10.1109\/CVPR42600.2020.00252"},{"key":"27_CR61","doi-asserted-by":"crossref","unstructured":"Sun, P., et al.: Dancetrack: multi-object tracking in uniform appearance and diverse motion. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 20993\u201321002 (2022)","DOI":"10.1109\/CVPR52688.2022.02032"},{"key":"27_CR62","unstructured":"Sun, P., et al.: Transtrack: multiple object tracking with transformer. arXiv preprint arXiv:2012.15460 (2020)"},{"key":"27_CR63","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1016\/j.cviu.2017.04.011","volume":"159","author":"G Thomas","year":"2017","unstructured":"Thomas, G., Gade, R., Moeslund, T.B., Carr, P., Hilton, A.: Computer vision for sports: current applications and research topics. Comput. Vis. Image Underst. 159, 3\u201318 (2017)","journal-title":"Comput. Vis. Image Underst."},{"key":"27_CR64","doi-asserted-by":"publisher","unstructured":"Thomee, B., etal.: Yfcc100 m: the new data in multimedia research. Commun. ACM 59(2), 64\u201373 (2016). https:\/\/doi.org\/10.1145\/2812802","DOI":"10.1145\/2812802"},{"key":"27_CR65","doi-asserted-by":"crossref","unstructured":"Valmadre, J., et al.: Long-term tracking in the wild: a benchmark. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 670\u2013685 (2018)","DOI":"10.1007\/978-3-030-01219-9_41"},{"key":"27_CR66","unstructured":"Wang, X., Li, C., Yang, R., Zhang, T., Tang, J., Luo, B.: Describe and attend to track: learning natural language guided structural representation and visual attention for object tracking. arXiv preprint arXiv:1811.10014 (2018)"},{"key":"27_CR67","doi-asserted-by":"crossref","unstructured":"Wang, X., et al.: Towards more flexible and accurate object tracking with natural language: algorithms and benchmark. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 13763\u201313773, June 2021","DOI":"10.1109\/CVPR46437.2021.01355"},{"key":"27_CR68","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1007\/978-3-030-58621-8_7","volume-title":"Computer Vision \u2013 ECCV 2020","author":"Z Wang","year":"2020","unstructured":"Wang, Z., Zheng, L., Liu, Y., Li, Y., Wang, S.: Towards real-time multi-object tracking. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020, Part XI. LNCS, vol. 12356, pp. 107\u2013122. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58621-8_7"},{"key":"27_CR69","doi-asserted-by":"publisher","first-page":"102907","DOI":"10.1016\/j.cviu.2020.102907","volume":"193","author":"L Wen","year":"2020","unstructured":"Wen, L., et al.: UA-DETRAC: a new benchmark and protocol for multi-object detection and tracking. Comput. Vis. Image Underst. 193, 102907 (2020)","journal-title":"Comput. Vis. Image Underst."},{"key":"27_CR70","doi-asserted-by":"publisher","unstructured":"Wojke, N., Bewley, A.: Deep cosine metric learning for person re-identification. In: 2018 IEEE Winter Conference on Applications of Computer Vision (WACV), pp. 748\u2013756. IEEE (2018). https:\/\/doi.org\/10.1109\/WACV.2018.00087","DOI":"10.1109\/WACV.2018.00087"},{"issue":"9","key":"27_CR71","doi-asserted-by":"publisher","first-page":"1834","DOI":"10.1109\/TPAMI.2014.2388226","volume":"37","author":"Y Wu","year":"2015","unstructured":"Wu, Y., Lim, J., Yang, M.H.: Object tracking benchmark. IEEE Trans. Pattern Anal. Mach. Intell. 37(9), 1834\u20131848 (2015)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"27_CR72","doi-asserted-by":"publisher","first-page":"374","DOI":"10.1007\/978-3-031-19812-0_22","volume-title":"Computer Vision - ECCV 2022","author":"L Xu","year":"2022","unstructured":"Xu, L., Qu, H., Kuen, J., Gu, J., Liu, J.: Meta spatio-temporal debiasing for video scene graph generation. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision - ECCV 2022, pp. 374\u2013390. Springer Nature Switzerland, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19812-0_22"},{"key":"27_CR73","doi-asserted-by":"crossref","unstructured":"Yu, F., et al.: Bdd100k: a diverse driving dataset for heterogeneous multitask learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2636\u20132645 (2020)","DOI":"10.1109\/CVPR42600.2020.00271"},{"key":"27_CR74","doi-asserted-by":"publisher","unstructured":"Zeng, F., Dong, B., Zhang, Y., Wang, T., Zhang, X., Wei, Y.: MOTR: end-to-end multiple-object tracking with transformer. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision - ECCV 2022, ECCV 2022, Part XXVII, LNCS, vol. 13687, pp. 659\u2013675. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19812-0_38","DOI":"10.1007\/978-3-031-19812-0_38"},{"key":"27_CR75","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3232854","author":"C Zhang","year":"2022","unstructured":"Zhang, C., et al.: Webuav-3m: a benchmark for unveiling the power of million-scale deep UAV tracking. IEEE Trans. Pattern Anal. Mach. Intell. (2022). https:\/\/doi.org\/10.1109\/TPAMI.2022.3232854","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"27_CR76","first-page":"1","volume":"131","author":"L Zhang","year":"2022","unstructured":"Zhang, L., Gao, J., Xiao, Z., Fan, H.: Animaltrack: a benchmark for multi-animal tracking in the wild. Int. J. Comput. Vis. 131, 1\u201318 (2022)","journal-title":"Int. J. Comput. Vis."},{"key":"27_CR77","unstructured":"Zhang, X., Zhao, Z., Tsiligkaridis, T., Zitnik, M.: Self-supervised contrastive pre-training for time series via time-frequency consistency. In: Proceedings of Neural Information Processing Systems, NeurIPS (2022)"},{"key":"27_CR78","doi-asserted-by":"crossref","unstructured":"Zhang, Y., et al.: Bytetrack: multi-object tracking by associating every detection box (2022)","DOI":"10.1007\/978-3-031-20047-2_1"},{"key":"27_CR79","doi-asserted-by":"publisher","first-page":"3069","DOI":"10.1007\/s11263-021-01513-4","volume":"129","author":"Y Zhang","year":"2021","unstructured":"Zhang, Y., Wang, C., Wang, X., Zeng, W., Liu, W.: Fairmot: on the fairness of detection and re-identification in multiple object tracking. Int. J. Comput. Vision 129, 3069\u20133087 (2021)","journal-title":"Int. J. Comput. Vision"},{"key":"27_CR80","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.neucom.2021.05.011","volume":"455","author":"Y Zhang","year":"2021","unstructured":"Zhang, Y., Wang, T., Liu, K., Zhang, B., Chen, L.: Recent advances of single-object tracking methods: a brief survey. Neurocomputing 455, 1\u201311 (2021)","journal-title":"Neurocomputing"},{"key":"27_CR81","doi-asserted-by":"crossref","unstructured":"Zhao, H., Torralba, A., Torresani, L., Yan, Z.: Hacs: human action clips and segments dataset for recognition and temporal localization. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 8668\u20138678 (2019)","DOI":"10.1109\/ICCV.2019.00876"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-72691-0_27","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,2]],"date-time":"2024-11-02T18:10:53Z","timestamp":1730571053000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-72691-0_27"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,3]]},"ISBN":["9783031726903","9783031726910"],"references-count":81,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-72691-0_27","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,3]]},"assertion":[{"value":"3 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}