{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,14]],"date-time":"2026-07-14T13:08:01Z","timestamp":1784034481969,"version":"3.55.0"},"reference-count":16,"publisher":"Institute of Electronics, Information and Communications Engineers (IEICE)","issue":"1","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEICE Trans. Inf. &amp; Syst."],"published-print":{"date-parts":[[2024,1,1]]},"DOI":"10.1587\/transinf.2023edl8053","type":"journal-article","created":{"date-parts":[[2023,12,31]],"date-time":"2023-12-31T22:39:13Z","timestamp":1704062353000},"page":"161-164","source":"Crossref","is-referenced-by-count":3,"title":["Robust Visual Tracking Using Hierarchical Vision Transformer with Shifted Windows Multi-Head Self-Attention"],"prefix":"10.1587","volume":"E107.D","author":[{"given":"Peng","family":"GAO","sequence":"first","affiliation":[{"name":"School of Cyber Science and Engineering, Qufu Normal University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xin-Yue","family":"ZHANG","sequence":"additional","affiliation":[{"name":"School of Cyber Science and Engineering, Qufu Normal University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiao-Li","family":"YANG","sequence":"additional","affiliation":[{"name":"School of Cyber Science and Engineering, Qufu Normal University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jian-Cheng","family":"NI","sequence":"additional","affiliation":[{"name":"School of Cyber Science and Engineering, Qufu Normal University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fei","family":"WANG","sequence":"additional","affiliation":[{"name":"School of Electronics and Information Engineering, Harbin Institute of Technology"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"532","reference":[{"key":"1","doi-asserted-by":"publisher","unstructured":"[1] P. Gao, Q. Zhang, F. Wang, L. Xiao, H. Fujita, and Y. Zhang, \u201cLearning reinforced attentional representation for end-to-end visual tracking,\u201d Information Sciences, vol.517, pp.52-67, 2020. 10.1016\/j.ins.2019.12.084","DOI":"10.1016\/j.ins.2019.12.084"},{"key":"2","doi-asserted-by":"crossref","unstructured":"[2] L. Bertinetto, J. Valmadre, J.F. Henriques, A. Vedaldi, and P.H.S. Torr, \u201cFully-convolutional Siamese networks for object tracking,\u201d ECCV, pp.850-865, 2016. 10.1007\/978-3-319-48881-3_56","DOI":"10.1007\/978-3-319-48881-3_56"},{"key":"3","doi-asserted-by":"crossref","unstructured":"[3] G. Bhat, M. Danelljan, L.V. Gool, and R. Timofte, \u201cLearning discriminative model prediction for tracking,\u201d ICCV, pp.6182-6191, 2019. 10.1109\/iccv.2019.00628","DOI":"10.1109\/ICCV.2019.00628"},{"key":"4","unstructured":"[4] A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A.N. Gomez, \u0141. Kaiser, and I. Polosukhin, \u201cAttention is all you need,\u201d NeurIPS, vol.30, 2017."},{"key":"5","doi-asserted-by":"crossref","unstructured":"[5] Z. Liu, Y. Lin, Y. Cao, H. Hu, Y. Wei, Z. Zhang, S. Lin, and B. Guo, \u201cSwin transformer: Hierarchical vision transformer using shifted windows,\u201d ICCV, pp.10012-10022, 2021. 10.1109\/iccv48922.2021.00986","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"6","unstructured":"[6] J. Thangavel, T. Kokul, A. Ramanan, and S. Fernando, \u201cTransformers in single object tracking: An experimental survey,\u201d arXiv preprint arXiv:2302.11867, 2023."},{"key":"7","doi-asserted-by":"crossref","unstructured":"[7] K. He, X. Zhang, S. Ren, and J. Sun, \u201cDeep residual learning for image recognition,\u201d CVPR, pp.770-778, 2016. 10.1109\/cvpr.2016.90","DOI":"10.1109\/CVPR.2016.90"},{"key":"8","doi-asserted-by":"publisher","unstructured":"[8] L. Huang, X. Zhao, and K. Huang, \u201cGot-10k: A large high-diversity benchmark for generic object tracking in the wild,\u201d IEEE Trans. Pattern Anal. Mach. Intell., vol.43, no.5, pp.1562-1577, 2021. 10.1109\/tpami.2019.2957464","DOI":"10.1109\/TPAMI.2019.2957464"},{"key":"9","doi-asserted-by":"crossref","unstructured":"[9] T.-Y. Lin, M. Maire, S. Belongie, J. Hays, P. Perona, D. Ramanan, P. Doll\u00e1r, and C.L. Zitnick, \u201cMicrosoft COCO: Common objects in context,\u201d ECCV, pp.740-755, 2014. 10.1007\/978-3-319-10602-1_48","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"10","doi-asserted-by":"crossref","unstructured":"[10] M. M\u00fcller, A. Bibi, S. Giancola, S. Alsubaihi, and B. Ghanem, \u201cTrackingNet: A large-scale dataset and benchmark for object tracking in the wild,\u201d ECCV, pp.310-327, 2018. 10.1007\/978-3-030-01246-5_19","DOI":"10.1007\/978-3-030-01246-5_19"},{"key":"11","doi-asserted-by":"crossref","unstructured":"[11] G. Bhat, M. Danelljan, L. Van Gool, and R. Timofte, \u201cKnow your surroundings: Exploiting scene information for object tracking,\u201d ECCV, pp.205-221, 2020. 10.1007\/978-3-030-58592-1_13","DOI":"10.1007\/978-3-030-58592-1_13"},{"key":"12","doi-asserted-by":"crossref","unstructured":"[12] Z. Zhang, H. Peng, J. Fu, B. Li, and W. Hu, \u201cOcean: Object-aware anchor-free tracking,\u201d ECCV, pp.771-787, 2020. 10.1007\/978-3-030-58589-1_46","DOI":"10.1007\/978-3-030-58589-1_46"},{"key":"13","doi-asserted-by":"crossref","unstructured":"[13] B. Li, W. Wu, Q. Wang, F. Zhang, J. Xing, and J. Yan, \u201cSiamRPN++: Evolution of Siamese visual tracking with very deep networks,\u201d CVPR, pp.4282-4291, 2019. 10.1109\/cvpr.2019.00441","DOI":"10.1109\/CVPR.2019.00441"},{"key":"14","doi-asserted-by":"crossref","unstructured":"[14] A. Luke\u017ei\u010d, J. Matas, and M. Kristan, \u201cD3S \u2014 A discriminative single shot segmentation tracker,\u201d CVPR, pp.7133-7142, 2020. 10.1109\/cvpr42600.2020.00716","DOI":"10.1109\/CVPR42600.2020.00716"},{"key":"15","doi-asserted-by":"crossref","unstructured":"[15] D. Xing, N. Evangeliou, A. Tsoukalas, and A. Tzes, \u201cSiamese transformer pyramid networks for real-time UAV tracking,\u201d WACV, pp.2139-2148, 2022. 10.1109\/wacv51458.2022.00196","DOI":"10.1109\/WACV51458.2022.00196"},{"key":"16","doi-asserted-by":"publisher","unstructured":"[16] Y. Cui, D. Guo, Y. Shao, Z. Wang, C. Shen, L. Zhang, and S. Chen, \u201cJoint classification and regression for visual tracking with fully convolutional Siamese networks,\u201d International Journal of Computer Vision, vol.130, no.2, pp.550-566, 2022. 10.1007\/s11263-021-01559-4","DOI":"10.1007\/s11263-021-01559-4"}],"container-title":["IEICE Transactions on Information and Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E107.D\/1\/E107.D_2023EDL8053\/_pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,6]],"date-time":"2024-01-06T04:14:17Z","timestamp":1704514457000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E107.D\/1\/E107.D_2023EDL8053\/_article"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,1,1]]},"references-count":16,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2024]]}},"URL":"https:\/\/doi.org\/10.1587\/transinf.2023edl8053","relation":{},"ISSN":["0916-8532","1745-1361"],"issn-type":[{"value":"0916-8532","type":"print"},{"value":"1745-1361","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,1,1]]},"article-number":"2023EDL8053"}}