{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,27]],"date-time":"2025-09-27T17:01:50Z","timestamp":1758992510581,"version":"3.44.0"},"reference-count":44,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2025,4,29]],"date-time":"2025-04-29T00:00:00Z","timestamp":1745884800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,4,29]],"date-time":"2025-04-29T00:00:00Z","timestamp":1745884800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100002858","name":"China Postdoctoral Science Foundation","doi-asserted-by":"publisher","award":["2023M732022"],"award-info":[{"award-number":["2023M732022"]}],"id":[{"id":"10.13039\/501100002858","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100016087","name":"Qufu Normal University","doi-asserted-by":"publisher","award":["167-602801"],"award-info":[{"award-number":["167-602801"]}],"id":[{"id":"10.13039\/100016087","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2025,7]]},"DOI":"10.1007\/s10489-025-06588-x","type":"journal-article","created":{"date-parts":[[2025,4,29]],"date-time":"2025-04-29T03:15:26Z","timestamp":1745896526000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Learning nested attentional feature fusion network for high performance visual tracking"],"prefix":"10.1007","volume":"55","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2230-3937","authenticated-orcid":false,"given":"Peng","family":"Gao","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xin-Yue","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tao","family":"Yu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,4,29]]},"reference":[{"issue":"5","key":"6588_CR1","doi-asserted-by":"publisher","first-page":"3943","DOI":"10.1109\/TITS.2020.3046478","volume":"23","author":"SM Marvasti-Zadeh","year":"2022","unstructured":"Marvasti-Zadeh SM, Cheng L, Ghanei-Yakhdan H, Kasaei S (2022) Deep learning for visual tracking: A comprehensive survey. IEEE Trans Intell Transp Syst 23(5):3943\u20133968","journal-title":"IEEE Trans Intell Transp Syst"},{"key":"6588_CR2","doi-asserted-by":"crossref","unstructured":"Javed S, Danelljan M, Khan FS, Khan MH, Felsberg M, Matas J (2022a) Visual object tracking with discriminative filters and siamese networks: a survey and outlook. IEEE Trans Patt Anal Mach Intell","DOI":"10.1109\/TPAMI.2022.3212594"},{"key":"6588_CR3","doi-asserted-by":"crossref","unstructured":"Kugarajeevan J, Kokul T, Ramanan A, Fernando S (2023) Transformers in single object tracking: An experimental survey. IEEE Access","DOI":"10.1109\/ACCESS.2023.3298440"},{"key":"6588_CR4","doi-asserted-by":"crossref","unstructured":"Bertinetto L, Valmadre J, Henriques J, Vedaldi A, Torr PHS (2016) Fully-convolutional siamese networks for object tracking. in: European conference on computer vision (ECCV), Springer-Verlag, pp 850\u2013865","DOI":"10.1007\/978-3-319-48881-3_56"},{"key":"6588_CR5","doi-asserted-by":"crossref","unstructured":"Li B, Yan J, Wu W, Zhu Z, Hu X (2018) High performance visual tracking with siamese region proposal network. In: IEEE conference on computer vision and pattern recognition (CVPR), IEEE, pp 8971\u20138980","DOI":"10.1109\/CVPR.2018.00935"},{"issue":"2","key":"6588_CR6","doi-asserted-by":"publisher","first-page":"550","DOI":"10.1007\/s11263-021-01559-4","volume":"130","author":"Y Cui","year":"2022","unstructured":"Cui Y, Guo D, Shao Y, Wang Z, Shen C, Zhang L, Chen S (2022) Joint classification and regression for visual tracking with fully convolutional siamese networks. Int J Comput Vision 130(2):550\u2013566","journal-title":"Int J Comput Vision"},{"key":"6588_CR7","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.122013","volume":"238","author":"P Gao","year":"2024","unstructured":"Gao P, Zhang X-Y, Yang X-L, Gao F, Fujita H, Wang F (2024) Robust visual tracking with extreme point graph-guided annotation: Approach and experiment. Expert Syst Appl 238:122013","journal-title":"Expert Syst Appl"},{"issue":"3","key":"6588_CR8","doi-asserted-by":"publisher","first-page":"583","DOI":"10.1109\/TPAMI.2014.2345390","volume":"37","author":"JF Henriques","year":"2015","unstructured":"Henriques JF, Caseiro R, Martins P, Batista J (2015) High-speed tracking with kernelized correlation filters. IEEE Trans Pattern Anal Mach Intell 37(3):583\u2013596","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"6588_CR9","doi-asserted-by":"crossref","unstructured":"Valmadre J, Bertinetto L, Henriques J, Vedaldi A, Torr PHS (2017) End-to-end representation learning for correlation filter based tracking. In: IEEE Conference on computer vision and pattern recognition (CVPR), IEEE, pp 2805\u20132813","DOI":"10.1109\/CVPR.2017.531"},{"issue":"105448","key":"6588_CR10","first-page":"1","volume":"193","author":"P Gao","year":"2020","unstructured":"Gao P, Yuan R, Wang F, Xiao L, Fujita H, Zhang Y (2020) Siamese attentional keypoint network for high performance visual tracking. Knowl-Based Syst 193(105448):1\u201316","journal-title":"Knowl-Based Syst"},{"issue":"2","key":"6588_CR11","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s10489-024-05984-z","volume":"55","author":"W-J Tang","year":"2025","unstructured":"Tang W-J, Liu X, Gao P, Wang F, Yuan R-Y (2025) Searching a lightweight network architecture for thermal infrared pedestrian tracking. Appl Intell 55(2):1\u201314","journal-title":"Appl Intell"},{"key":"6588_CR12","doi-asserted-by":"crossref","unstructured":"Yu Y, Xiong Y, Huang W, Scott MR (2020) Deformable siamese attention networks for visual object tracking. In: IEEE conference on computer vision and pattern recognition (CVPR), IEEE, pp 6728\u20136737","DOI":"10.1109\/CVPR42600.2020.00676"},{"key":"6588_CR13","doi-asserted-by":"publisher","first-page":"52","DOI":"10.1016\/j.ins.2019.12.084","volume":"517","author":"P Gao","year":"2020","unstructured":"Gao P, Zhang Q, Wang F, Xiao L, Fujita H, Zhang Y (2020) Learning reinforced attentional representation for end-to-end visual tracking. Inf Sci 517:52\u201367","journal-title":"Inf Sci"},{"key":"6588_CR14","doi-asserted-by":"crossref","unstructured":"Yan B, Peng H, Fu J, Wang D, Lu H (2021) Learning spatio-temporal transformer for visual tracking. In: International conference on computer vision (ICCV), IEEE, pp 10448\u201310457","DOI":"10.1109\/ICCV48922.2021.01028"},{"key":"6588_CR15","doi-asserted-by":"crossref","unstructured":"Mayer C, Danelljan M, Bhat G, Paul M, Paudel DP, Yu F, Van\u00a0Gool L (2022) Transforming model prediction for tracking. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 8731\u20138740","DOI":"10.1109\/CVPR52688.2022.00853"},{"key":"6588_CR16","doi-asserted-by":"crossref","unstructured":"Yan B, Jiang Y, Sun P, Wang D, Yuan Z, Luo P, Lu H (2022) Towards grand unification of object tracking. In: European conference on computer vision, Springer, pp 733\u2013751","DOI":"10.1007\/978-3-031-19803-8_43"},{"key":"6588_CR17","doi-asserted-by":"crossref","unstructured":"Wang N, Zhou W, Wang J, Li H (2021) Transformer meets tracker: Exploiting temporal context for robust visual tracking. In: IEEE conference on computer vision and pattern recognition (CVPR), pp 1571\u20131580","DOI":"10.1109\/CVPR46437.2021.00162"},{"key":"6588_CR18","doi-asserted-by":"crossref","unstructured":"Chen X, Yan B, Zhu J, Wang D, Yang X, Lu H (2021) Transformer tracking. In: IEEE conference on computer vision and pattern recognition (CVPR), IEEE, pp 8126\u20138135","DOI":"10.1109\/CVPR46437.2021.00803"},{"key":"6588_CR19","doi-asserted-by":"crossref","unstructured":"Gao S, Zhou C, Ma C, Wang X, Yuan J (2022) Aiatrack: Attention in attention for transformer visual tracking. In: European conference on computer vision, Springer, pp 146\u2013164","DOI":"10.1007\/978-3-031-20047-2_9"},{"issue":"6","key":"6588_CR20","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"39","author":"S Ren","year":"2017","unstructured":"Ren S, He K, Girshick R, Sun J (2017) Faster r-cnn: Towards real-time object detection with region proposal networks. IEEE Trans Pattern Anal Mach Intell 39(6):1137\u20131149","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"6588_CR21","doi-asserted-by":"crossref","unstructured":"Zhu Z, Wang Q, Li B, Wu W, Yan J, Hu W (2018) Distractor-aware siamese networks for visual object tracking. In: European conference on computer vision (ECCV), Springer-Verlag, pp 103\u2013119","DOI":"10.1007\/978-3-030-01240-3_7"},{"key":"6588_CR22","doi-asserted-by":"crossref","unstructured":"Li B, Wu W, Wang Q, Zhang F, Xing J, Yan J (2019) Siamrpn++: Evolution of siamese visual tracking with very deep networks. In: IEEE conference on computer vision and pattern recognition (CVPR), IEEE, pp 4282\u20134291","DOI":"10.1109\/CVPR.2019.00441"},{"key":"6588_CR23","doi-asserted-by":"crossref","unstructured":"Yang T, Chan AB (2018) Learning dynamic memory networks for object tracking. In: Proceedings of the European conference on computer vision (ECCV), pp 152\u2013167","DOI":"10.1007\/978-3-030-01240-3_10"},{"key":"6588_CR24","doi-asserted-by":"crossref","unstructured":"Li P, Chen B, Ouyang W, Wang D, Yang X, Lu H (2019) Gradnet: Gradient-guided network for visual object tracking. In: International conference on computer vision (ICCV), IEEE, pp 6162\u20136171","DOI":"10.1109\/ICCV.2019.00626"},{"key":"6588_CR25","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez AN, Kaiser \u0141, Polosukhin I (2024) Attention is all you need. Adv Neural Inf Process Syst 30"},{"key":"6588_CR26","unstructured":"Dosovitskiy A, Beyer L, Kolesnikov A, Weissenborn D, Zhai X, Unterthiner T, Dehghani M, Minderer M, Heigold G, Gelly S et\u00a0al (2020) An image is worth 16$$\\times $$16 words: Transformers for image recognition at scale. In: International conference on learning representations"},{"key":"6588_CR27","doi-asserted-by":"crossref","unstructured":"Cui Y, Jiang C, Wang L, Wu G (2022) Mixformer: End-to-end tracking with iterative mixed attention. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 13608\u201313618","DOI":"10.1109\/CVPR52688.2022.01324"},{"key":"6588_CR28","doi-asserted-by":"crossref","unstructured":"Ye B, Chang H, Ma B, Shan S, Chen X (2022) Joint feature learning and relation modeling for tracking: A one-stream framework. In: European conference on computer vision, Springer, pp 341\u2013357","DOI":"10.1007\/978-3-031-20047-2_20"},{"key":"6588_CR29","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: IEEE conference on computer vision and pattern recognition (CVPR), IEEE, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"6588_CR30","doi-asserted-by":"crossref","unstructured":"Jiang B, Luo R, Mao J, Xiao T, Jiang Y (2018) Acquisition of localization confidence for accurate object detection. In: Proceedings of the European conference on computer vision (ECCV), pp 784\u2013799","DOI":"10.1007\/978-3-030-01264-9_48"},{"key":"6588_CR31","doi-asserted-by":"crossref","unstructured":"Carion N, Massa F, Synnaeve G, Usunier N, Kirillov A, Zagoruyko S (2020) End-to-end object detection with transformers. In: European conference on computer vision, Springer, pp 213\u2013229","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"6588_CR32","doi-asserted-by":"crossref","unstructured":"Rezatofighi H, Tsoi N, Gwak J, Sadeghian A, Reid I, Savarese S (2019) Generalized intersection over union: A metric and a loss for bounding box regression. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 658\u2013666","DOI":"10.1109\/CVPR.2019.00075"},{"key":"6588_CR33","doi-asserted-by":"crossref","unstructured":"Lin TY, Maire M, Belongie S, Hays J, Perona P, Ramanan D, Doll\u00e1r P, Zitnick CL (2014) Microsoft coco: Common objects in context. In: European conference on computer vision (ECCV), Springer-Verlag, pp 740\u2013755","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"6588_CR34","doi-asserted-by":"crossref","unstructured":"Muller M, Bibi A, Giancola S, Alsubaihi S, Ghanem B (2018) Trackingnet: A large-scale dataset and benchmark for object tracking in the wild. In: European conference on computer vision (ECCV), Springer, pp 300\u2013317","DOI":"10.1007\/978-3-030-01246-5_19"},{"issue":"2","key":"6588_CR35","doi-asserted-by":"publisher","first-page":"439","DOI":"10.1007\/s11263-020-01387-y","volume":"129","author":"H Fan","year":"2021","unstructured":"Fan H, Bai H, Lin L, Yang F, Chu P, Deng G, Yu S, Huang M, Liu J, Xu Y et al (2021) Lasot: A high-quality large-scale single object tracking benchmark. Int J Comput Vision 129(2):439\u2013461","journal-title":"Int J Comput Vision"},{"issue":"5","key":"6588_CR36","doi-asserted-by":"publisher","first-page":"1562","DOI":"10.1109\/TPAMI.2019.2957464","volume":"43","author":"L Huang","year":"2019","unstructured":"Huang L, Zhao X, Huang K (2019) Got-10k: A large high-diversity benchmark for generic object tracking in the wild. IEEE Trans Pattern Anal Mach Intell 43(5):1562\u20131577","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"9","key":"6588_CR37","doi-asserted-by":"publisher","first-page":"1834","DOI":"10.1109\/TPAMI.2014.2388226","volume":"37","author":"Y Wu","year":"2015","unstructured":"Wu Y, Lim J, Yang M-H (2015) Object tracking benchmark. IEEE Trans Pattern Anal Mach Intell 37(9):1834\u20131848","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"6588_CR38","doi-asserted-by":"crossref","unstructured":"Mueller M, Smith N, Ghanem B (2016) A benchmark and simulator for uav tracking. In: European conference on computer vision (ECCV), Springer, pp 445\u2013461","DOI":"10.1007\/978-3-319-46448-0_27"},{"key":"6588_CR39","doi-asserted-by":"crossref","unstructured":"Mayer C, Danelljan M, Paudel DP, Van\u00a0Gool L (2021) Learning target candidate association to keep track of what not to track. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 13444\u201313454","DOI":"10.1109\/ICCV48922.2021.01319"},{"key":"6588_CR40","doi-asserted-by":"crossref","unstructured":"Yu B, Tang M, Zheng L, Zhu G, Wang J, Feng H, Feng X, Lu H (2021) High-performance discriminative tracking with transformers. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 9856\u20139865","DOI":"10.1109\/ICCV48922.2021.00971"},{"key":"6588_CR41","doi-asserted-by":"crossref","unstructured":"Zhang Z, Peng H, Fu J, Li B, Hu W (2020) Ocean: Object-aware anchor-free tracking. In: European conference on computer vision (ECCV), Springer, pp 771\u2013787","DOI":"10.1007\/978-3-030-58589-1_46"},{"key":"6588_CR42","doi-asserted-by":"crossref","unstructured":"Voigtlaender P, Luiten J, Torr PH, Leibe B (2020) Siam r-cnn: Visual tracking by re-detection. In: IEEE conference on computer vision and pattern recognition (CVPR), IEEE, pp 6578\u20136588","DOI":"10.1109\/CVPR42600.2020.00661"},{"key":"6588_CR43","doi-asserted-by":"crossref","unstructured":"Danelljan M, Gool LV, Timofte R (2020) Probabilistic regression for visual tracking. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 7183\u20137192","DOI":"10.1109\/CVPR42600.2020.00721"},{"key":"6588_CR44","doi-asserted-by":"crossref","unstructured":"Gao P, Zhang X-Y, Yang X-L, Ni J-C, Wang F (2024) Robust visual tracking using hierarchical vision transformer with shifted windows multi-head self-attention. IEICE Trans Inf Syst 107(1):161\u2013164","DOI":"10.1587\/transinf.2023EDL8053"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-025-06588-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-025-06588-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-025-06588-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,19]],"date-time":"2025-09-19T13:58:31Z","timestamp":1758290311000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-025-06588-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,29]]},"references-count":44,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2025,7]]}},"alternative-id":["6588"],"URL":"https:\/\/doi.org\/10.1007\/s10489-025-06588-x","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"type":"print","value":"0924-669X"},{"type":"electronic","value":"1573-7497"}],"subject":[],"published":{"date-parts":[[2025,4,29]]},"assertion":[{"value":"22 April 2025","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 April 2025","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"703"}}