{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,4]],"date-time":"2026-04-04T18:07:38Z","timestamp":1775326058968,"version":"3.50.1"},"reference-count":60,"publisher":"Springer Science and Business Media LLC","issue":"9","license":[{"start":{"date-parts":[[2025,6,26]],"date-time":"2025-06-26T00:00:00Z","timestamp":1750896000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,6,26]],"date-time":"2025-06-26T00:00:00Z","timestamp":1750896000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"National Natural Science Foundation of Chinaunder Grants","award":["62473341"],"award-info":[{"award-number":["62473341"]}]},{"name":"Distinguished Youth Science Foundation of Henan province of China under Grant","award":["242300421055"],"award-info":[{"award-number":["242300421055"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Supercomput"],"DOI":"10.1007\/s11227-025-07472-8","type":"journal-article","created":{"date-parts":[[2025,6,26]],"date-time":"2025-06-26T04:42:48Z","timestamp":1750912968000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Vision-language discriminative fusion network for object tracking"],"prefix":"10.1007","volume":"81","author":[{"given":"Jianwei","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinyu","family":"Yan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Huanlong","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liusen","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bin","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bineng","family":"Zhong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,6,26]]},"reference":[{"key":"7472_CR1","first-page":"4446","volume":"35","author":"M Guo","year":"2022","unstructured":"Guo M, Zhang Z, Fan H, Jing L (2022) Divert more attention to vision-language tracking. Adv Neural Inf Process Syst 35:4446\u20134460","journal-title":"Adv Neural Inf Process Syst"},{"key":"7472_CR2","doi-asserted-by":"crossref","unstructured":"Wang X, Shu X, Zhang Z, Jiang B, Wang Y, Tian Y, Wu F (2021) Towards More Flexible and Accurate Object Tracking with Natural Language: Algorithms and benchmark. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 13763\u201313773","DOI":"10.1109\/CVPR46437.2021.01355"},{"issue":"7","key":"7472_CR3","doi-asserted-by":"publisher","first-page":"9186","DOI":"10.1109\/TPAMI.2022.3232854","volume":"45","author":"C Zhang","year":"2022","unstructured":"Zhang C, Huang G, Liu L, Huang S, Yang Y, Wan X, Ge S, Tao D (2022) Webuav-3m: A benchmark for unveiling the power of million-scale deep uav tracking. IEEE Trans Pattern Anal Mach Intell 45(7):9186\u20139205","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"7472_CR4","doi-asserted-by":"crossref","unstructured":"Yin J, Wang W, Meng Q, Yang R, Shen J (2020) A Unified Object Motion and Affinity Model for Online Multi-object Tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 6768\u20136777","DOI":"10.1109\/CVPR42600.2020.00680"},{"issue":"7","key":"7472_CR5","doi-asserted-by":"publisher","first-page":"2012","DOI":"10.1109\/TCSVT.2018.2862151","volume":"29","author":"W Shen","year":"2018","unstructured":"Shen W, Wu Y, Yuan J, Duan L, Zhang J, Jia Y (2018) Robust distracter-resistive tracker via learning a multi-component discriminative dictionary. IEEE Trans Circuits Syst Video Technol 29(7):2012\u20132028","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"7472_CR6","doi-asserted-by":"publisher","first-page":"1720","DOI":"10.1109\/TMM.2023.3285441","volume":"26","author":"H Zhang","year":"2023","unstructured":"Zhang H, Wang J, Zhang J, Zhang T, Zhong B (2023) One-stream vision-language memory network for object tracking. IEEE Trans Multimed 26:1720\u20131730","journal-title":"IEEE Trans Multimed"},{"key":"7472_CR7","doi-asserted-by":"publisher","first-page":"2125","DOI":"10.1109\/TCSVT.2023.3301933","volume":"34","author":"Y Zheng","year":"2023","unstructured":"Zheng Y, Zhong B, Liang Q, Li G, Ji R, Li X (2023) Towards unified token learning for vision-language tracking. IEEE Trans Circuits Syst Video Technol 34:2125\u20132135","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"7472_CR8","doi-asserted-by":"crossref","unstructured":"Zhou L, Zhou Z, Mao K, He Z (2023) Joint Visual Grounding and Tracking with Natural Language Specification. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 23151\u201323160","DOI":"10.1109\/CVPR52729.2023.02217"},{"key":"7472_CR9","doi-asserted-by":"publisher","first-page":"10","DOI":"10.1016\/j.patrec.2023.02.023","volume":"168","author":"H Zhao","year":"2023","unstructured":"Zhao H, Wang X, Wang D, Lu H, Ruan X (2023) Transformer vision-language tracking via proxy token guided cross-modal fusion. Pattern Recognit Lett 168:10\u201316","journal-title":"Pattern Recognit Lett"},{"key":"7472_CR10","doi-asserted-by":"crossref","unstructured":"Li X, Huang Y, He Z, Wang Y, Lu H, Yang M-H (2023) Citetracker: Correlating Image and Text for Visual Tracking. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 9974\u20139983","DOI":"10.1109\/ICCV51070.2023.00915"},{"key":"7472_CR11","doi-asserted-by":"crossref","unstructured":"Zhang C, Sun X, Yang Y, Liu L, Liu Q, Zhou X, Wang Y (2023) All in One: Exploring Unified Vision-Language Tracking with Multi-modal Alignment. In: Proceedings of the 31st ACM International Conference on Multimedia, pp 5552\u20135561","DOI":"10.1145\/3581783.3611803"},{"key":"7472_CR12","unstructured":"Liu Y (2019) Roberta: A robustly optimized bert pretraining approach. arXiv preprint arXiv:1907.11692 364"},{"key":"7472_CR13","unstructured":"Dosovitskiy A (2020) An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929"},{"key":"7472_CR14","doi-asserted-by":"crossref","unstructured":"Guo D, Wang J, Cui Y, Wang Z, Chen S (2020) Siamcar: Siamese Fully Convolutional Classification and Regression for Visual Tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 6269\u20136277","DOI":"10.1109\/CVPR42600.2020.00630"},{"key":"7472_CR15","doi-asserted-by":"crossref","unstructured":"Bertinetto L, Valmadre J, Henriques JF, Vedaldi A, Torr PH (2016) Fully-Convolutional Siamese Networks for Object Tracking. In: Computer Vision\u2013ECCV 2016 Workshops: Amsterdam, The Netherlands, October 8-10 and 15-16, 2016, Proceedings, Part II 14, pp 850\u2013865. Springer","DOI":"10.1007\/978-3-319-48881-3_56"},{"key":"7472_CR16","doi-asserted-by":"crossref","unstructured":"Li B, Yan J, Wu W, Zhu Z, Hu X (2018) High Performance Visual Tracking with Siamese Region Proposal Network. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 8971\u20138980","DOI":"10.1109\/CVPR.2018.00935"},{"key":"7472_CR17","doi-asserted-by":"crossref","unstructured":"Chen X, Yan B, Zhu J, Wang D, Yang X, Lu H (2021) Transformer Tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 8126\u20138135","DOI":"10.1109\/CVPR46437.2021.00803"},{"key":"7472_CR18","doi-asserted-by":"crossref","unstructured":"Yan B, Peng H, Fu J, Wang D, Lu H (2021) Learning Spatio-Temporal Transformer for Visual Tracking. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 10448\u201310457","DOI":"10.1109\/ICCV48922.2021.01028"},{"issue":"9","key":"7472_CR19","doi-asserted-by":"publisher","first-page":"3433","DOI":"10.1109\/TCSVT.2020.3038720","volume":"31","author":"Z Yang","year":"2020","unstructured":"Yang Z, Kumar T, Chen T, Su J, Luo J (2020) Grounding-tracking-integration. IEEE Trans Circuits Syst Video Technol 31(9):3433\u20133443","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"7472_CR20","doi-asserted-by":"crossref","unstructured":"Li Y, Yu J, Cai Z, Pan Y (2022) Cross-Modal Target Retrieval for Tracking by Natural Language. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 4931\u20134940","DOI":"10.1109\/CVPRW56347.2022.00540"},{"key":"7472_CR21","doi-asserted-by":"crossref","unstructured":"Li Z, Tao R, Gavves E, Snoek CG, Smeulders AW (2017) Tracking by Natural Language Specification. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 6495\u20136503","DOI":"10.1109\/CVPR.2017.777"},{"key":"7472_CR22","doi-asserted-by":"crossref","unstructured":"Ye B, Chang H, Ma B, Shan S, Chen X (2022) Joint Feature Learning and Relation Modeling for Tracking: A one-stream framework. In: European Conference on Computer Vision, pp 341\u2013357. Springer","DOI":"10.1007\/978-3-031-20047-2_20"},{"key":"7472_CR23","doi-asserted-by":"crossref","unstructured":"Xu Y, Wang Z, Li Z, Yuan Y, Yu G (2020) Siamfc++: Towards Robust and Accurate Visual Tracking with Target Estimation Guidelines. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, pp 12549\u201312556","DOI":"10.1609\/aaai.v34i07.6944"},{"key":"7472_CR24","doi-asserted-by":"crossref","unstructured":"Bhat G, Danelljan M, Gool LV, Timofte R (2019) Learning Discriminative Model Prediction for Tracking. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 6182\u20136191","DOI":"10.1109\/ICCV.2019.00628"},{"key":"7472_CR25","doi-asserted-by":"crossref","unstructured":"Danelljan M, Gool LV, Timofte R (2020) Probabilistic Regression for Visual Tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 7183\u20137192","DOI":"10.1109\/CVPR42600.2020.00721"},{"key":"7472_CR26","doi-asserted-by":"crossref","unstructured":"Rezatofighi H, Tsoi N, Gwak J, Sadeghian A, Reid I, Savarese S (2019) Generalized Intersection Over Union: A Metric and a Loss for Bounding Box Regression. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 658\u2013666","DOI":"10.1109\/CVPR.2019.00075"},{"key":"7472_CR27","doi-asserted-by":"crossref","unstructured":"Chen X, Peng H, Wang D, Lu H, Hu H (2023) Seqtrack: Sequence to Sequence Learning for Visual Object Tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 14572\u201314581","DOI":"10.1109\/CVPR52729.2023.01400"},{"key":"7472_CR28","doi-asserted-by":"crossref","unstructured":"Wei X, Bai Y, Zheng Y, Shi D, Gong Y (2023) Autoregressive Visual Tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 9697\u20139706","DOI":"10.1109\/CVPR52729.2023.00935"},{"issue":"1","key":"7472_CR29","doi-asserted-by":"publisher","first-page":"10","DOI":"10.1007\/s13735-023-00276-7","volume":"12","author":"R Li","year":"2023","unstructured":"Li R, Li N, Wang W (2023) Maximizing mutual information inside intra-and inter-modality for audio-visual event retrieval. Int J Multimed Inf Retr 12(1):10","journal-title":"Int J Multimed Inf Retr"},{"key":"7472_CR30","first-page":"3954","volume":"34","author":"Z Gao","year":"2020","unstructured":"Gao Z, Wu Y, Zhang X, Dai J, Jia Y, Harandi M (2020) Revisiting bilinear pooling: A coding perspective. Proc AAAI Conf Artif Intell 34:3954\u20133961","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"7472_CR31","first-page":"3070","volume":"33","author":"R Saqur","year":"2020","unstructured":"Saqur R, Narasimhan K (2020) Multimodal graph networks for compositional generalization in visual question answering. Adv Neural Inf Process Syst 33:3070\u20133081","journal-title":"Adv Neural Inf Process Syst"},{"key":"7472_CR32","unstructured":"Jia C, Yang Y, Xia Y, Chen Y-T, Parekh Z, Pham H, Le Q, Sung Y-H, Li Z, Duerig T (2021) Scaling Up Visual and Vision-Language Representation Learning with Noisy Text Supervision. In: International Conference on Machine Learning, pp 4904\u20134916. PMLR"},{"issue":"5","key":"7472_CR33","doi-asserted-by":"publisher","first-page":"131","DOI":"10.1007\/s10462-025-11126-9","volume":"58","author":"R Pillalamarri","year":"2025","unstructured":"Pillalamarri R, Shanmugam U (2025) A review on eeg-based multimodal learning for emotion recognition. Artif Intell Rev 58(5):131","journal-title":"Artif Intell Rev"},{"key":"7472_CR34","unstructured":"Zadrozny W, Hematialam H, Garbayo L (2017) Towards semantic modeling of contradictions and disagreements: A case study of medical guidelines. arXiv preprint arXiv:1708.00850"},{"key":"7472_CR35","unstructured":"Heltai P (2005) Explicitation, redundancy, ellipsis and translation. New Trends in Translation Studies. In: Hounour of Kinga Klaudy. Budapest: BPH, 46\u201349"},{"key":"7472_CR36","unstructured":"Lu J, Batra D, Parikh D, Lee S (2019) Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. Advances in neural information processing systems 32"},{"key":"7472_CR37","doi-asserted-by":"crossref","unstructured":"Tan H, Bansal M (2019) Lxmert: Learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490","DOI":"10.18653\/v1\/D19-1514"},{"key":"7472_CR38","doi-asserted-by":"crossref","unstructured":"Dou Z-Y, Xu Y, Gan Z, Wang J, Wang S, Wang L, Zhu C, Zhang P, Yuan L, Peng N et al. (2022) An Empirical Study of Training End-to-End Vision-and-Language Transformers. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 18166\u201318176","DOI":"10.1109\/CVPR52688.2022.01763"},{"key":"7472_CR39","doi-asserted-by":"crossref","unstructured":"Wei X, Zhang T, Li Y, Zhang Y, Wu F (2020) Multi-modality Cross Attention Network for Image and Sentence Matching. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 10941\u201310950","DOI":"10.1109\/CVPR42600.2020.01095"},{"key":"7472_CR40","doi-asserted-by":"crossref","unstructured":"Gao S, Zhou C, Ma C, Wang X, Yuan J (2022) Aiatrack: Attention in Attention for Transformer Visual Tracking. In: European Conference on Computer Vision, pp 146\u2013164. Springer","DOI":"10.1007\/978-3-031-20047-2_9"},{"key":"7472_CR41","doi-asserted-by":"publisher","first-page":"469","DOI":"10.1109\/TPAMI.2024.3468315","volume":"47","author":"Y Wei","year":"2024","unstructured":"Wei Y, Hu D, Du H, Wen J-R (2024) On-the-fly modulation for balanced multimodal learning. IEEE Trans Pattern Anal Mach Intell 47:469\u2013485","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"7472_CR42","unstructured":"Simonyan K, Zisserman A (2014) Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556"},{"key":"7472_CR43","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep Residual Learning for Image Recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"7472_CR44","doi-asserted-by":"crossref","unstructured":"Huang G, Liu Z, Van Der\u00a0Maaten L, Weinberger KQ (2017) Densely Connected Convolutional Networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp 4700\u20134708","DOI":"10.1109\/CVPR.2017.243"},{"key":"7472_CR45","doi-asserted-by":"crossref","unstructured":"Liu Z, Lin Y, Cao Y, Hu H, Wei Y, Zhang Z, Lin S, Guo B (2021) Swin Transformer: Hierarchical Vision Transformer Using Shifted Windows. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 10012\u201310022","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"7472_CR46","first-page":"15908","volume":"34","author":"K Han","year":"2021","unstructured":"Han K, Xiao A, Wu E, Guo J, Xu C, Wang Y (2021) Transformer in transformer. Adv Neural Inf Process Systems 34:15908\u201315919","journal-title":"Adv Neural Inf Process Systems"},{"key":"7472_CR47","unstructured":"Devlin J (2018) Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805"},{"key":"7472_CR48","unstructured":"Radford A, Kim JW, Hallacy C, Ramesh A, Goh G, Agarwal S, Sastry G, Askell A, Mishkin P, Clark J et al. (2021) Learning Transferable Visual Models from Natural Language Supervision. In: International Conference on Machine Learning, pp 8748\u20138763. PMLR"},{"key":"7472_CR49","doi-asserted-by":"crossref","unstructured":"Fan H, Lin L, Yang F, Chu P, Deng G, Yu S, Bai H, Xu Y, Liao C, Ling H (2019) Lasot: A High-Quality Benchmark for Large-Scale Single Object Tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 5374\u20135383","DOI":"10.1109\/CVPR.2019.00552"},{"key":"7472_CR50","unstructured":"Loshchilov I, Hutter F (2019) Decoupled Weight Decay Regularization. 7th int. In: Conf. Learn. Represent. ICLR"},{"key":"7472_CR51","doi-asserted-by":"crossref","unstructured":"Li B, Wu W, Wang Q, Zhang F, Xing J, Yan J (2019) Siamrpn++: Evolution of Siamese Visual Tracking with Very Deep Networks. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 4282\u20134291","DOI":"10.1109\/CVPR.2019.00441"},{"key":"7472_CR52","doi-asserted-by":"crossref","unstructured":"Chen Z, Zhong B, Li G, Zhang S, Ji R (2020) Siamese Box Adaptive Network for Visual Tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 6668\u20136677","DOI":"10.1109\/CVPR42600.2020.00670"},{"key":"7472_CR53","doi-asserted-by":"crossref","unstructured":"Guo M, Zhang Z, Fan H, Jing L, Lyu Y, Li B, Hu W (2022) Learning Target-Aware Representation for Visual Tracking via Informative Interactions. arXiv preprint arXiv:2201.02526","DOI":"10.24963\/ijcai.2022\/130"},{"key":"7472_CR54","first-page":"7588","volume":"38","author":"Y Zheng","year":"2024","unstructured":"Zheng Y, Zhong B, Liang Q, Mo Z, Zhang S, Li X (2024) Odtrack: Online Dense Temporal Token Learning for Visual Tracking. Proc AAAI Conf Artif Intell 38:7588\u20137596","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"7472_CR55","doi-asserted-by":"crossref","unstructured":"Feng Q, Ablavsky V, Bai Q, Sclaroff S (2021) Siamese Natural Language Tracker: Tracking by Natural Language Descriptions with Siamese Trackers. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 5851\u20135860","DOI":"10.1109\/CVPR46437.2021.00579"},{"key":"7472_CR56","doi-asserted-by":"publisher","first-page":"9053","DOI":"10.1109\/TCSVT.2024.3395352","volume":"34","author":"G Zhang","year":"2024","unstructured":"Zhang G, Zhong B, Liang Q, Mo Z, Li N, Song S (2024) One-stream stepwise decreasing for vision-language tracking. IEEE Trans Circuits Syst Video Technol 34:9053\u20139063","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"7472_CR57","doi-asserted-by":"crossref","unstructured":"Shao Y, He S, Ye Q, Feng Y, Luo W, Chen J (2024) Context-Aware Integration of Language and Visual References for Natural Language Tracking. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 19208\u201319217","DOI":"10.1109\/CVPR52733.2024.01817"},{"key":"7472_CR58","doi-asserted-by":"crossref","unstructured":"Lin L, Fan H, Zhang Z, Wang Y, Xu Y, Ling H (2024) Tracking Meets lora: Faster Training, Larger Model, Stronger Performance. In: European Conference on Computer Vision, pp 300\u2013318. Springer","DOI":"10.1007\/978-3-031-73232-4_17"},{"key":"7472_CR59","doi-asserted-by":"crossref","unstructured":"Zhou Z, Chen J, Pei W, Mao K, Wang H, He Z (2022) Global Tracking via Ensemble of Local Trackers. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 8761\u20138770","DOI":"10.1109\/CVPR52688.2022.00857"},{"key":"7472_CR60","doi-asserted-by":"publisher","first-page":"439","DOI":"10.1007\/s11263-020-01387-y","volume":"129","author":"H Fan","year":"2021","unstructured":"Fan H, Bai H, Lin L, Yang F, Chu P, Deng G, Yu S, Harshit, Huang M, Liu J et al (2021) Lasot: A high-quality large-scale single object tracking benchmark. Int J Comput Vis 129:439\u2013461","journal-title":"Int J Comput Vis"}],"container-title":["The Journal of Supercomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-025-07472-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11227-025-07472-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-025-07472-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,26]],"date-time":"2025-06-26T04:43:01Z","timestamp":1750912981000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11227-025-07472-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,26]]},"references-count":60,"journal-issue":{"issue":"9","published-online":{"date-parts":[[2025,6]]}},"alternative-id":["7472"],"URL":"https:\/\/doi.org\/10.1007\/s11227-025-07472-8","relation":{},"ISSN":["1573-0484"],"issn-type":[{"value":"1573-0484","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,6,26]]},"assertion":[{"value":"16 May 2025","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"26 June 2025","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that there are no Conflict of interest regarding the publication of this paper.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"The research presented in this paper does not involve any human or animal subjects. All data used in this study are publicly available. Therefore, no ethical approval or informed consent was required for this research.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethics approval and consent to participate"}}],"article-number":"1079"}}