{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T03:07:35Z","timestamp":1784603255712,"version":"3.55.0"},"reference-count":212,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2021,3,4]],"date-time":"2021-03-04T00:00:00Z","timestamp":1614816000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2021,3,4]],"date-time":"2021-03-04T00:00:00Z","timestamp":1614816000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int. J. Autom. Comput."],"published-print":{"date-parts":[[2021,6]]},"abstract":"<jats:title>Abstract<\/jats:title><jats:p>Recently, deep learning has achieved great success in visual tracking tasks, particularly in single-object tracking. This paper provides a comprehensive review of state-of-the-art single-object tracking algorithms based on deep learning. First, we introduce basic knowledge of deep visual tracking, including fundamental concepts, existing algorithms, and previous reviews. Second, we briefly review existing deep learning methods by categorizing them into data-invariant and data-adaptive methods based on whether they can dynamically change their model parameters or architectures. Then, we conclude with the general components of deep trackers. In this way, we systematically analyze the novelties of several recently proposed deep trackers. Thereafter, popular datasets such as Object Tracking Benchmark (OTB) and Visual Object Tracking (VOT) are discussed, along with the performances of several deep trackers. Finally, based on observations and experimental results, we discuss three different characteristics of deep trackers, i.e., the relationships between their general components, exploration of more effective tracking frameworks, and interpretability of their motion estimation components.<\/jats:p>","DOI":"10.1007\/s11633-020-1274-8","type":"journal-article","created":{"date-parts":[[2021,3,4]],"date-time":"2021-03-04T04:42:05Z","timestamp":1614832925000},"page":"311-333","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":19,"title":["Advances in Deep Learning Methods for Visual Tracking: Literature Review and Fundamentals"],"prefix":"10.1007","volume":"18","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0958-7285","authenticated-orcid":false,"given":"Xiao-Qin","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2402-8684","authenticated-orcid":false,"given":"Run-Hua","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8793-1726","authenticated-orcid":false,"given":"Chen-Xiang","family":"Fan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7045-8867","authenticated-orcid":false,"given":"Tian-Yu","family":"Tong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0202-0174","authenticated-orcid":false,"given":"Tao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3695-2022","authenticated-orcid":false,"given":"Peng-Cheng","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2021,3,4]]},"reference":[{"issue":"5","key":"1274_CR1","doi-asserted-by":"publisher","first-page":"564","DOI":"10.1109\/TPAMI.2003.1195991","volume":"25","author":"D Comaniciu","year":"2003","unstructured":"D. Comaniciu, V. Ramesh, P. Meer. Kernel-based object tracking. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 25, no. 5, pp. 564\u2013577, 2003. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2003.1195991.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1274_CR2","doi-asserted-by":"publisher","first-page":"661","DOI":"10.1007\/3_540-47969-4_44","volume-title":"Proceedings of the 7th European Conference on Computer Vision","author":"P Perez","year":"2002","unstructured":"P. Perez, C. Hue, J. Vermaak, M. Gangnet. Color-based probabilistic tracking. In Proceedings of the 7th European Conference on Computer Vision, Springer, Copenhagen, Denmark, pp. 661\u2013675, 2002. DOI: https:\/\/doi.org\/10.1007\/3_540-47969-4_44."},{"issue":"5","key":"1274_CR3","doi-asserted-by":"publisher","first-page":"603","DOI":"10.1109\/34.1000236","volume":"24","author":"D Comaniciu","year":"2002","unstructured":"D. Comaniciu, P. Meer. Mean shift: A robust approach toward feature space analysis. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 24, no. 5, pp. 603\u2013619, 2002. DOI: https:\/\/doi.org\/10.1109\/34.1000236.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"1","key":"1274_CR4","doi-asserted-by":"publisher","first-page":"5","DOI":"10.1023\/A:1008078328650","volume":"29","author":"M Isard","year":"1998","unstructured":"M. Isard, A. Blake. CONDENSATION-conditional density propagation for visual tracking. International Journal of Computer Vision, vol. 29, no. 1, pp. 5\u201328, 1998. DOI: https:\/\/doi.org\/10.1023\/A:1008078328650.","journal-title":"International Journal of Computer Vision"},{"issue":"7","key":"1274_CR5","doi-asserted-by":"publisher","first-page":"1428","DOI":"10.1109\/TPAMI.2013.213","volume":"36","author":"J Kwon","year":"2014","unstructured":"J. Kwon, K. M. Lee. Tracking by sampling and integratingmultiple trackers. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 36, no. 7, pp. 1428\u20131441, 2014. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2013.213.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1274_CR6","doi-asserted-by":"publisher","first-page":"798","DOI":"10.1109\/CVPR.2006.256","volume-title":"Proceedings of IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"A Adam","year":"2006","unstructured":"A. Adam, E. Rivlin, I. Shimshoni. Robust fragments-based tracking using the integral histogram. In Proceedings of IEEE Computer Society Conference on Computer Vision and Pattern Recognition, IEEE, New York, USA, pp. 798\u2013805, 2006. DOI: https:\/\/doi.org\/10.1109\/CVPR.2006.256."},{"issue":"1\u20133","key":"1274_CR7","doi-asserted-by":"publisher","first-page":"125","DOI":"10.1007\/s11263-007-0075-7","volume":"77","author":"D A Ross","year":"2008","unstructured":"D. A. Ross, J. Lim, R. S. Lin, M. H. Yang. Incremental learning for robust visual tracking. International Journal of Computer Vision, vol. 77, no. 1\u20133, pp. 125\u2013141, 2008. DOI: https:\/\/doi.org\/10.1007\/s11263-007-0075-7.","journal-title":"International Journal of Computer Vision"},{"issue":"11","key":"1274_CR8","doi-asserted-by":"publisher","first-page":"2259","DOI":"10.1109\/TPAMI.2011.66","volume":"33","author":"X Mei","year":"2011","unstructured":"X. Mei, H. B. Ling. Robust visual tracking and vehicle classification via sparse representation. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 33, no. 11, pp. 2259\u20132272, 2011. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2011.66.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"1","key":"1274_CR9","doi-asserted-by":"publisher","first-page":"314","DOI":"10.1109\/TIP.2012.2202677","volume":"22","author":"D Wang","year":"2013","unstructured":"D. Wang, H. C. Lu, M. H. Yang. Online object tracking with sparse prototypes. IEEE Transactions on Image Processing, vol. 22, no. 1, pp. 314\u2013325, 2013. DOI: https:\/\/doi.org\/10.1109\/TIP.2012.2202677.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1274_CR10","doi-asserted-by":"publisher","first-page":"260","DOI":"10.1109\/CVPR.2006.215","volume-title":"Proceedings of IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"H Grabner","year":"2006","unstructured":"H. Grabner, H. Bischof. On-line boosting and vision. In Proceedings of IEEE Computer Society Conference on Computer Vision and Pattern Recognition, IEEE, New York, USA, pp. 260\u2013267, 2006. DOI: https:\/\/doi.org\/10.1109\/CVPR.2006.215."},{"issue":"2","key":"1274_CR11","doi-asserted-by":"publisher","first-page":"261","DOI":"10.1109\/TPAMI.2007.35","volume":"29","author":"S Avidan","year":"2007","unstructured":"S. Avidan. Ensemble tracking. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 29, no. 2, pp. 261\u2013271, 2007. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2007.35.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"8","key":"1274_CR12","doi-asserted-by":"publisher","first-page":"1064","DOI":"10.1109\/TPAMI.2004.53","volume":"26","author":"S Avidan","year":"2004","unstructured":"S. Avidan. Support vector tracking. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 26, no. 8, pp. 1064\u20131072, 2004. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2004.53.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1274_CR13","doi-asserted-by":"publisher","first-page":"1393","DOI":"10.1109\/ICCVW.2009.5457447","volume-title":"Proceedings of the 12th IEEE International Conference on Computer Vision Workshops","author":"A Saffari","year":"2009","unstructured":"A. Saffari, C. Leistner, J. Santner, M. Godec, H. Bischof. On-line random forests. In Proceedings of the 12th IEEE International Conference on Computer Vision Workshops, IEEE, Kyoto, Japan, pp. 1393\u20131400, 2009. DOI: https:\/\/doi.org\/10.1109\/ICCVW.2009.5457447."},{"issue":"8","key":"1274_CR14","doi-asserted-by":"publisher","first-page":"1619","DOI":"10.1109\/TPAMI.2010.226","volume":"33","author":"B Babenko","year":"2010","unstructured":"B. Babenko, M. H. Yang, S. Belongie. Robust object tracking with online multiple instance learning. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 33, no. 8, pp. 1619\u20131632, 2010. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2010.226.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"8","key":"1274_CR15","doi-asserted-by":"publisher","first-page":"2288","DOI":"10.1109\/TIP.2011.2114895","volume":"20","author":"N Jiang","year":"2011","unstructured":"N. Jiang, W. Y. Liu, Y. Wu. Learning adaptive metric for robust visual tracking. IEEE Transactions on Image Processing, vol. 20, no. 8, pp. 2288\u20132300, 2011. DOI: https:\/\/doi.org\/10.1109\/TIP.2011.2114895.","journal-title":"IEEE Transactions on Image Processing"},{"issue":"7553","key":"1274_CR16","doi-asserted-by":"publisher","first-page":"436","DOI":"10.1038\/nature14539","volume":"521","author":"Y LeCun","year":"2015","unstructured":"Y. LeCun, Y. Bengio, G. Hinton. Deep learning. Nature, vol. 521, no. 7553, pp. 436\u2013444, 2015. DOI: https:\/\/doi.org\/10.1038\/nature14539.","journal-title":"Nature"},{"issue":"1","key":"1274_CR17","doi-asserted-by":"publisher","first-page":"142","DOI":"10.1109\/TPAMI.2015.2437384","volume":"38","author":"R Girshick","year":"2016","unstructured":"R. Girshick, J. Donahue, T. Darrell, J. Malik. Region-based convolutional networks for accurate object detection and segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 38, no. 1, pp. 142\u2013158, 2016. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2015.2437384.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1274_CR18","doi-asserted-by":"publisher","unstructured":"X. Q. Zhang, R. H. Jiang, T. Wang, P. C. Huang, L. Zhao. Attention-based interpolation network for video deblurring. Neurocomputing, 2020. DOI: https:\/\/doi.org\/10.1016\/j.neucom.2020.04.147.","DOI":"10.1016\/j.neucom.2020.04.147"},{"key":"1274_CR19","doi-asserted-by":"publisher","first-page":"4835","DOI":"10.1109\/ICASSP.2017.7953075","volume-title":"Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing","author":"S Kim","year":"2017","unstructured":"S. Kim, T. Hori, S. Watanabe. Joint CTC-attention based end-to-end speech recognition using multi-task learning. In Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing, IEEE, New Orleans, USA, pp. 4835\u20134839, 2017. DOI: https:\/\/doi.org\/10.1109\/ICASSP.2017.7953075."},{"key":"1274_CR20","doi-asserted-by":"publisher","first-page":"4460","DOI":"10.1109\/ICASSP.2015.7178814","volume-title":"Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing","author":"Z Z Wu","year":"2015","unstructured":"Z. Z. Wu, C. Valentini-Botinhao, O. Watts, S. King. Deep neural networks employing multi-task learning and stacked bottleneck features for speech synthesis. In Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing, IEEE, Brisbane, Australia, pp. 4460\u20134464, 2015. DOI: https:\/\/doi.org\/10.1109\/ICASSP.2015.7178814."},{"key":"1274_CR21","unstructured":"D. Bahdanau, K. Cho, Y. Bengio. Neural machine translation by jointly learning to align and translate. [Online], Available: https:\/\/arxiv.org\/abs\/1409.0473, 2014."},{"key":"1274_CR22","unstructured":"O. Vinyals, L. Kaiser, T. Koo, S. Petrov, I. Sutskever, G. Hinton. Grammar as a foreign language. In Proceedings of the 28th International Conference on Neural Information Processing Systems, Cambridge, USA, pp. 2773\u20132781, 2015."},{"key":"1274_CR23","doi-asserted-by":"publisher","first-page":"3119","DOI":"10.1109\/ICCV.2015.357","volume-title":"Proceedings of IEEE International Conference on Computer Vision","author":"L J Wang","year":"2015","unstructured":"L. J. Wang, W. L. Ouyang, X. G. Wang, H. C. Lu. Visual tracking with fully convolutional networks. In Proceedings of IEEE International Conference on Computer Vision, IEEE, Santiago, Chile, pp. 3119\u20133127, 2015. DOI: https:\/\/doi.org\/10.1109\/ICCV.2015.357."},{"key":"1274_CR24","doi-asserted-by":"publisher","first-page":"4293","DOI":"10.1109\/CVPR.2016.465","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"H Nam","year":"2016","unstructured":"H. Nam, B. Han. Learning multi-domain convolutional neural networks for visual tracking. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Las Vegas, USA, pp. 4293\u20134302, 2016. DOI: https:\/\/doi.org\/10.1109\/CVPR.2016.465."},{"key":"1274_CR25","doi-asserted-by":"publisher","first-page":"1373","DOI":"10.1109\/CVPR.2016.153","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"L J Wang","year":"2016","unstructured":"L. J. Wang, W. L. Ouyang, X. G. Wang, H. C. Lu. STCT: Sequentially training convolutional networks for visual tracking. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Las Vegas, USA, pp. 1373\u20131381, 2016. DOI: https:\/\/doi.org\/10.1109\/CVPR.2016.153."},{"key":"1274_CR26","doi-asserted-by":"publisher","first-page":"1420","DOI":"10.1109\/CVPR.2016.158","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"R Tao","year":"2016","unstructured":"R. Tao, E. Gavves, A. W. M. Smeulders. Siamese instance search for tracking. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Las Vegas, USA, pp. 1420\u20131429, 2016. DOI: https:\/\/doi.org\/10.1109\/CVPR.2016.158."},{"key":"1274_CR27","doi-asserted-by":"publisher","first-page":"2411","DOI":"10.1109\/CVPR.2013.312","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"Y Wu","year":"2013","unstructured":"Y. Wu, J. Lim, M. H. Yang. Online object tracking: A benchmark. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Portland, USA, pp. 2411\u20132418, 2013. DOI: https:\/\/doi.org\/10.1109\/CVPR.2013.312."},{"key":"1274_CR28","unstructured":"M. Kristan, R. Pflugfelder, A. Leonardis, J. Matas, F. Porikli, L. Cehovin, G. Nebehay, G. Fernandez, T. Vojir. The VOT2013 challenge: Overview and additional results. In Proceedings of the 19th Computer Vision Winter Workshop, Krtiny, Czech Republic, 2014."},{"key":"1274_CR29","doi-asserted-by":"publisher","unstructured":"X. Li, W. M. Hu, C. H. Shen, Z. F. Zhang, A. Dick, A. Van Den Hengel. A survey of appearance models in visual object tracking. ACM Transactions on Intelligent Systems and Technology, vol. 4, no. 4, Article number 58, 2013. DOI: https:\/\/doi.org\/10.1145\/2508037.2508039.","DOI":"10.1145\/2508037.2508039"},{"issue":"1","key":"1274_CR30","doi-asserted-by":"publisher","first-page":"61","DOI":"10.16451\/j.cnki.issn1003-6059.201801006","volume":"31","author":"H C Lu","year":"2018","unstructured":"H. C. Lu, P. X. Li, D. Wang. Visual object tracking: A survey. Pattern Recognition and Artificial Intelligence, vol. 31, no. 1, pp. 61\u201376, 2018. DOI: https:\/\/doi.org\/10.16451\/j.cnki.issn1003-6059.201801006. (in Chinese)","journal-title":"Pattern Recognition and Artificial Intelligence"},{"key":"1274_CR31","doi-asserted-by":"publisher","first-page":"323","DOI":"10.1016\/j.patcog.2017.11.007","volume":"76","author":"P X Li","year":"2018","unstructured":"P. X. Li, D. Wang, L. J. Wang, H. C. Lu. Deep visual tracking: Review and experimental comparison. Pattern Recognition, vol. 76, pp. 323\u2013338, 2018. DOI: https:\/\/doi.org\/10.1016\/j.patcog.2017.11.007.","journal-title":"Pattern Recognition"},{"issue":"12","key":"1274_CR32","first-page":"2057","volume":"24","author":"X Li","year":"2019","unstructured":"X. Li, Y. F. Zha, T. Z. Zhang, Z. Cui, W. M. Zuo, Z. Q. Hou, H. C. Lu, H. Z. Wang. Survey of visual object tracking algorithms based on deep learning. Journal of Image and Graphics, vol. 24, no. 12, pp. 2057\u20132080, 2019. (in Chinese)","journal-title":"Journal of Image and Graphics"},{"key":"1274_CR33","doi-asserted-by":"publisher","first-page":"17","DOI":"10.1016\/j.neucom.2018.01.092","volume":"300","author":"A Brunetti","year":"2018","unstructured":"A. Brunetti, D. Buongiorno, G. F. Trotta, V. Bevilacqua. Computer vision and deep learning techniques for pedestrian detection and tracking: A survey. Neurocomputing, vol. 300, pp. 17\u201333, 2018. DOI: https:\/\/doi.org\/10.1016\/j.neucom.2018.01.092.","journal-title":"Neurocomputing"},{"key":"1274_CR34","doi-asserted-by":"publisher","unstructured":"R. Yao, G. S. Lin, S. X. Xia, J. Q. Zhao, Y. Zhou. Video object segmentation and tracking: A survey. ACM Transactions on Intelligent Systems and Technology, vol. 11, no. 4, Article number 36, 2020. DOI: https:\/\/doi.org\/10.1145\/3391743.","DOI":"10.1145\/3391743"},{"key":"1274_CR35","doi-asserted-by":"publisher","first-page":"3642","DOI":"10.1109\/CVPR.2012.6248110","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"D Ciregan","year":"2012","unstructured":"D. Ciregan, U. Meier, J. Schmidhuber. Multi-column deep neural networks for image classification. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Providence, USA, pp. 3642\u20133649, 2012. DOI: https:\/\/doi.org\/10.1109\/CVPR.2012.6248110."},{"issue":"11","key":"1274_CR36","doi-asserted-by":"publisher","first-page":"3212","DOI":"10.1109\/TNNLS.2018.2876865","volume":"30","author":"Z Q Zhao","year":"2019","unstructured":"Z. Q. Zhao, P. Zheng, S. T. Xu, X. D. Wu. Object detection with deep learning: A review. IEEE Transactions on Neural Networks and Learning Systems, vol. 30, no. 11, pp. 3212\u20133232, 2019. DOI: https:\/\/doi.org\/10.1109\/TNNLS.2018.2876865.","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"1274_CR37","doi-asserted-by":"publisher","first-page":"3431","DOI":"10.1109\/CVPR.2015.7298965","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"J Long","year":"2015","unstructured":"J. Long, E. Shelhamer, T. Darrell. Fully convolutional networks for semantic segmentation. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Boston, USA, pp. 3431\u20133440, 2015. DOI: https:\/\/doi.org\/10.1109\/CVPR.2015.7298965."},{"key":"1274_CR38","doi-asserted-by":"publisher","first-page":"3929","DOI":"10.1109\/CVPR.2017.300","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"K Zhang","year":"2017","unstructured":"K. Zhang, W. M. Zuo, S. H. Gu, L. Zhang. Learning deep CNN denoiser prior for image restoration. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Honolulu, USA, pp. 3929\u20133938, 2017. DOI: https:\/\/doi.org\/10.1109\/CVPR.2017.300."},{"issue":"4","key":"1274_CR39","doi-asserted-by":"publisher","first-page":"961","DOI":"10.1109\/TNN.2002.1021896","volume":"13","author":"X O Tang","year":"2002","unstructured":"X. O. Tang, X. B. Gao, J. Z. Liu, H. J. Zhang. A spatial-temporal approach for video caption detection and recognition. IEEE Transactions on Neural Networks, vol. 13, no. 4, pp. 961\u2013971, 2002. DOI: https:\/\/doi.org\/10.1109\/TNN.2002.1021896.","journal-title":"IEEE Transactions on Neural Networks"},{"key":"1274_CR40","doi-asserted-by":"publisher","first-page":"10","DOI":"10.24963\/ijcai.2018\/2","volume-title":"Proceedings of the 27th International Joint Conference on Artif\u00edcial Intelligence","author":"H Geffner","year":"2018","unstructured":"H. Geffner. Model-free, model-based, and general intelligence. In Proceedings of the 27th International Joint Conference on Artif\u00edcial Intelligence, AAAI Press, Stockholm, Sweden, pp. 10\u201317, 2018. DOI: https:\/\/doi.org\/10.24963\/ijcai.2018\/2."},{"key":"1274_CR41","unstructured":"T. Elsken, J. H. Metzen, F. Hutter. Neural architecture search: A survey. [Online], Available: https:\/\/arxiv.org\/abs\/1808.05377, 2018."},{"key":"1274_CR42","unstructured":"K. Simonyan, A. Zisserman. Very deep convolutional networks for large-scale image recognition. In Proceedings of the 3rd International Conference on Learning Representations, San Diego, USA, 2015."},{"key":"1274_CR43","doi-asserted-by":"publisher","first-page":"770","DOI":"10.1109\/CVPR.2016.90","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"K M He","year":"2016","unstructured":"K. M. He, X. Y. Zhang, S. Q. Ren, J. Sun. Deep residual learning for image recognition. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Las Vegas, USA, pp. 770\u2013778, 2016. DOI: https:\/\/doi.org\/10.1109\/CVPR.2016.90."},{"key":"1274_CR44","doi-asserted-by":"publisher","first-page":"4700","DOI":"10.1109\/CVPR.2017.243","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"G Huang","year":"2017","unstructured":"G. Huang, Z. Liu, L. Van Der Maaten, K. Q. Weinberger. Densely connected convolutional networks. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Honolulu, USA, pp. 4700\u20134708, 2017. DOI: https:\/\/doi.org\/10.1109\/CVPR.2017.243."},{"key":"1274_CR45","first-page":"4278","volume-title":"Proceedings of the 31st AAAI Conference on Artificial Intelligence","author":"C Szegedy","year":"2016","unstructured":"C. Szegedy, S. Ioffe, V. Vanhoucke, A. A. Alemi. Inception-v4, inception-ResNet and the impact of residual connections on learning. In Proceedings of the 31st AAAI Conference on Artificial Intelligence, AAAI Press, San Francisco, USA, pp. 4278\u20134284, 2016."},{"key":"1274_CR46","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/CVPR.2015.7298594","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"C Szegedy","year":"2015","unstructured":"C. Szegedy, W. Liu, Y. Q. Jia, P. Sermanet, S. Reed, D. Anguelov, D. Erhan, V. Vanhoucke, A. Rabinovich. Going deeper with convolutions. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Boston, USA, pp. 1\u20139, 2015. DOI: https:\/\/doi.org\/10.1109\/CVPR.2015.7298594."},{"key":"1274_CR47","doi-asserted-by":"crossref","unstructured":"C. S. Brito, W. Gerstner. Nonlinear Hebbian learning as a unifying principle in receptive field formation. PLoS computational biology, vol. 12, no. 9, Article number e1005070, 2016.","DOI":"10.1371\/journal.pcbi.1005070"},{"key":"1274_CR48","doi-asserted-by":"publisher","first-page":"2818","DOI":"10.1109\/CVPR.2016.308","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"C Szegedy","year":"2016","unstructured":"C. Szegedy, V. Vanhoucke, S. Ioffe, J. Shlens, Z. Wojna. Rethinking the inception architecture for computer vision. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Las Vegas, USA, pp. 2818\u20132826, 2016. DOI: https:\/\/doi.org\/10.1109\/CVPR.2016.308."},{"key":"1274_CR49","first-page":"6660","volume-title":"Proceedings of the 32nd International Conference on Neural Information Processing Systems","author":"Z Y Huo","year":"2018","unstructured":"Z. Y. Huo, B. Gu, H. Huang. Training neural networks using features replay. In Proceedings of the 32nd International Conference on Neural Information Processing Systems, ACM, Red Hook, USA, pp. 6660\u20136669, 2018."},{"key":"1274_CR50","unstructured":"J. Jeong, J. Shin. Training CNNs with selective allocation of channels. In Proceedings of the 36th International Conference on Machine Learning, Long Beach, pp. 3080\u20133090, 2019."},{"key":"1274_CR51","unstructured":"S. Y. Qiao, Z. S. Zhang, W. Shen, B. Wang, A. Yuille. Gradually updated neural networks for large-scale image recognition. In Proceedings of the 35th International Conference on Machine Learning, Stockholm, Sweden, pp. 4188\u20134197, 2018."},{"key":"1274_CR52","doi-asserted-by":"publisher","first-page":"1580","DOI":"10.1109\/CVPR42600.2020.00165","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"K Han","year":"2020","unstructured":"K. Han, Y. H. Wang, Q. Tian, J. Y. Guo, C. J. Xu, C. Xu. GhostNet: More features from cheap operations. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 1580\u20131589, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00165."},{"key":"1274_CR53","unstructured":"R. Geirhos, P. Rubisch, C. Michaelis, M. Bethge, F. A. Wichmann, W. Brendel. Image Net-trained CNNs are biased towards texture; increasing shape bias improves accuracy and robustness. [Online], Available: https:\/\/arxiv.org\/abs\/1811.12231, 2018."},{"key":"1274_CR54","doi-asserted-by":"publisher","first-page":"248","DOI":"10.1109\/CVPR.2009.5206848","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"J Deng","year":"2009","unstructured":"J. Deng, W. Dong, R. Socher, L. J. Li, K. Li, L. Fei-Fei. ImageNet: A large-scale hierarchical image database. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Miami, USA, pp. 248\u2013255, 2009. DOI: https:\/\/doi.org\/10.1109\/CVPR.2009.5206848."},{"key":"1274_CR55","unstructured":"J. Frankle, M. Carbin. The lottery ticket hypothesis: Finding sparse, trainable neural networks. [Online], Available: https:\/\/arxiv.org\/abs\/1803.03635, 2018."},{"key":"1274_CR56","unstructured":"J. You, J. Leskovec, K. He, S. Xie. Graph structure of neural networks. In Proceedings of the 37th International Conference on Machine Learning, Vienna, Austria, pp. 10881\u201310891, 2020."},{"key":"1274_CR57","doi-asserted-by":"publisher","first-page":"501","DOI":"10.1109\/CVPR.2019.00059","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"C H Xie","year":"2019","unstructured":"C. H. Xie, Y. X. Wu, L. Van Der Maaten, A. L. Yuille, K. M. He. Feature denoising for improving adversarial robustness. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 501\u2013509, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00059."},{"key":"1274_CR58","unstructured":"S. Kanai, Y. Fujiwara, S. Iwamura. Preventing gradient explosions in gated recurrent units. In Proceedings of the 31st International Conference on Neural Information Processing Systems, Long Beach, USA, pp. 435\u2013444, 2017."},{"issue":"2","key":"1274_CR59","doi-asserted-by":"publisher","first-page":"157","DOI":"10.1109\/72.279181","volume":"5","author":"Y Bengio","year":"1994","unstructured":"Y. Bengio, P. Simard, P. Frasconi. Learning long-term dependencies with gradient descent is difficult. IEEE Transactions on Neural Networks, vol. 5, no. 2, pp. 157\u2013166, 1994. DOI: https:\/\/doi.org\/10.1109\/72.279181.","journal-title":"IEEE Transactions on Neural Networks"},{"key":"1274_CR60","unstructured":"T. Mikolov. Statistical language models based on neural networks. Presentation at Google, vol. 80, Article number 26, 2012."},{"key":"1274_CR61","unstructured":"R. Pascanu, T. Mikolov, Y. Bengio. On the difficulty of training recurrent neural networks. In Proceedings of the 30th International Conference on International Conference on Machine Learning, Atlanta, USA, pp. 1310\u20131318, 2013."},{"issue":"8","key":"1274_CR62","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"S. Hochreiter, J. Schmidhuber. Long short-term memory. Neural Computation, vol. 9, no. 8, pp. 1735\u20131780, 1997. DOI: https:\/\/doi.org\/10.1162\/neco.1997.9.8.1735.","journal-title":"Neural Computation"},{"key":"1274_CR63","doi-asserted-by":"publisher","unstructured":"K. Cho, B. Van Merrienboer, C. Gulcehre, D. Bahdanau, F. Bougares, H. Schwenk, Y. Bengio. Learning phrase representations using RNN encoder-dec oder for statistical machine translation. In Proceedings of Conference on Empirical Methods in Natural Language Processing, Doha, Qatar, pp. 1724\u20131734, 2014. DOI: https:\/\/doi.org\/10.3115\/v1\/D14-1179.","DOI":"10.3115\/v1\/D14-1179"},{"key":"1274_CR64","first-page":"2342","volume-title":"Proceedings of the 32nd International Conference on International Conference on Machine Learning","author":"R Jozefowicz","year":"2015","unstructured":"R. Jozefowicz, W. Zaremba, I. Sutskever. An empirical exploration of recurrent network architectures. In Proceedings of the 32nd International Conference on International Conference on Machine Learning, JMLR.org, Lille, France, pp. 2342\u20132350, 2015."},{"issue":"3","key":"1274_CR65","doi-asserted-by":"publisher","first-page":"226","DOI":"10.1007\/s11633-016-1006-2","volume":"13","author":"G B Zhou","year":"2016","unstructured":"G. B. Zhou, J. X. Wu, C. L. Zhang, Z. H. Zhou. Minimal gated unit for recurrent neural networks. International Journal of Automation and Computing, vol. 13, no. 3, pp. 226\u2013234, 2016. DOI: https:\/\/doi.org\/10.1007\/s11633-016-1006-2.","journal-title":"International Journal of Automation and Computing"},{"issue":"3","key":"1274_CR66","doi-asserted-by":"publisher","first-page":"972","DOI":"10.1109\/TITS.2019.2900481","volume":"21","author":"B W Du","year":"2020","unstructured":"B. W. Du, H. Peng, S. Z. Wang, M. Z. A. Bhuiyan, L. H. Wang, Q. R. Gong, L. Liu, J. Li. Deep irregular convolutional residual LSTM for urban traffic passenger flows prediction. IEEE Transactions on Intelligent Transportation Systems, vol. 21, no. 3, pp. 972\u2013985, 2020. DOI: https:\/\/doi.org\/10.1109\/TITS.2019.2900481.","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"key":"1274_CR67","first-page":"735","volume-title":"Proceedings of the 27th International Conference on International Conference on Machine Learning","author":"J Martens","year":"2010","unstructured":"J. Martens. Deep learning via hessian-free optimization. In Proceedings of the 27th International Conference on International Conference on Machine Learning, ACM, Madison, USA, pp. 735\u2013742, 2010."},{"key":"1274_CR68","unstructured":"J. Martens, I. Sutskever. Learning recurrent neural networks with hessian-free optimization. In Proceedings of the 28th International Conference on International Conference on Machine Learning, Madison, USA, pp. 1033\u20131040, 2011."},{"key":"1274_CR69","unstructured":"I. Sutskever, J. Martens, G. Dahl, G. Hinton. On the importance of initialization and momentum in deep learning. In Proceedings of the 30th International Conference on International Conference on Machine Learning, Atlanta, USA, pp. 1139\u20131147, 2013."},{"issue":"11","key":"1274_CR70","doi-asserted-by":"publisher","first-page":"2673","DOI":"10.1109\/78.650093","volume":"45","author":"M Schuster","year":"1997","unstructured":"M. Schuster, K. K. Paliwal. Bidirectional recurrent neural networks. IEEE Transactions on Signal Processing, vol. 45, no. 11, pp. 2673\u20132681, 1997. DOI: https:\/\/doi.org\/10.1109\/78.650093.","journal-title":"IEEE Transactions on Signal Processing"},{"key":"1274_CR71","doi-asserted-by":"crossref","unstructured":"M. Sundermeyer, T. Alkhouli, J. Wuebker, H. Ney. Translation modeling with bidirectional recurrent neural networks. In Proceedings of Conference on Empirical Methods in Natural Language Processing, Doha, Qatar, pp. 14\u201325, 2014.","DOI":"10.3115\/v1\/D14-1003"},{"key":"1274_CR72","doi-asserted-by":"publisher","first-page":"7587","DOI":"10.1109\/ACCESS.2019.2962505","volume":"8","author":"R H Jiang","year":"2019","unstructured":"R. H. Jiang, L. Zhao, T. Wang, J. X. Wang, X. Q. Zhang. Video deblurring via temporally and spatially variant recurrent neural network. IEEE Access, vol. 8, pp. 7587\u20137597, 2019. DOI: https:\/\/doi.org\/10.1109\/ACCESS.2019.2962505.","journal-title":"IEEE Access"},{"key":"1274_CR73","doi-asserted-by":"publisher","first-page":"560","DOI":"10.1007\/978-3-319-46493-0_34","volume-title":"Proceedings of the 14th European Conference on Computer Vision","author":"S F Liu","year":"2016","unstructured":"S. F. Liu, J. S. Pan, M. H. Yang. Learning recursive filters for low-level vision via a hybrid neural network. In Proceedings of the 14th European Conference on Computer Vision, Springer, Amsterdam, The Netherlands, pp. 560\u2013576, 2016. DOI: https:\/\/doi.org\/10.1007\/978-3-319-46493-0_34."},{"key":"1274_CR74","doi-asserted-by":"publisher","first-page":"8690","DOI":"10.1609\/aaai.v33i01.33018690","volume":"33","author":"Z H Li","year":"2019","unstructured":"Z. H. Li, L. N. Yao, X. Q. Zhang, X. Z. Wang, S. Kanhere, H. Z. Zhang. Zero-shot object detection with textual descriptions. In Proceedings of the 33rd AAAI Conference on Artificial Intelligence, Honolulu, USA, vol. 33, pp. 8690\u20138697, 2019. DOI: https:\/\/doi.org\/10.1609\/aaai.v33i01.33018690.","journal-title":"Proceedings of the 33rd AAAI Conference on Artificial Intelligence"},{"key":"1274_CR75","doi-asserted-by":"crossref","unstructured":"G. Papandreou, L. C. Chen, K. Murphy, A. L. Yuille. Weakly-and semi-supervised learning of a DCNN for semantic image segmentation. [Online], Available: https:\/\/arxiv.org\/abs\/1502.02734, 2015.","DOI":"10.1109\/ICCV.2015.203"},{"key":"1274_CR76","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/ISCAS.2017.8050867","volume-title":"Proceedings of IEEE International Symposium on Circuits and Systems","author":"G H Ning","year":"2017","unstructured":"G. H. Ning, Z. Zhang, C. Huang, X. B. Ren, H. H. Wang, C. H. Cai, Z. H. He. Spatially supervised recurrent convolutional neural networks for visual object tracking. In Proceedings of IEEE International Symposium on Circuits and Systems, IEEE, Baltimore, USA, pp. 1\u20134, 2017. DOI: https:\/\/doi.org\/10.1109\/ISCAS.2017.8050867."},{"issue":"4","key":"1274_CR77","doi-asserted-by":"publisher","first-page":"1297","DOI":"10.1109\/TNNLS.2019.2919676","volume":"31","author":"Y D Chu","year":"2020","unstructured":"Y. D. Chu, J. T. Fei, S. X. Hou. Adaptive global slidingmode control for dynamic systems using double hidden layer recurrent neural network structure. IEEE Transactions on Neural Networks and Learning Systems, vol. 31, no. 4, pp. 1297\u20131309, 2020. DOI: https:\/\/doi.org\/10.1109\/TNNLS.2019.2919676.","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"1274_CR78","doi-asserted-by":"publisher","first-page":"5555","DOI":"10.1109\/CVPR.2019.00570","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"R Wang","year":"2019","unstructured":"R. Wang, S. M. Pizer, J. M. Frahm. Recurrent neural network for (un-) supervised learning of monocular video visual odometry and depth. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 5555\u20135564, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00570."},{"issue":"1","key":"1274_CR79","doi-asserted-by":"publisher","first-page":"4","DOI":"10.1109\/TNNLS.2020.2978386","volume":"32","author":"Z H Wu","year":"2021","unstructured":"Z. H. Wu, S. R. Pan, F. W. Chen, G. D. Long, C. Q. Zhang, P. S. Yu. A comprehensive survey on graph neural networks. IEEE Transactions on Neural Networks and Learning Systems, vol. 32, no. 1, pp. 4\u201324, 2021. DOI: https:\/\/doi.org\/10.1109\/TNNLS.2020.2978386.","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"1274_CR80","doi-asserted-by":"publisher","first-page":"729","DOI":"10.1109\/IJCNN.2005.1555942","volume-title":"Proceedings of IEEE International Joint Conference on Neural Networks","author":"M Gori","year":"2005","unstructured":"M. Gori, G. Monfardini, F. Scarselli. A new model for learning in graph domains. In Proceedings of IEEE International Joint Conference on Neural Networks, IEEE, Montreal, Canada, pp. 729\u2013734, 2005. DOI: https:\/\/doi.org\/10.1109\/IJCNN.2005.1555942."},{"issue":"1","key":"1274_CR81","doi-asserted-by":"publisher","first-page":"61","DOI":"10.1109\/TNN.2008.2005605","volume":"20","author":"F Scarselli","year":"2009","unstructured":"F. Scarselli, M. Gori, A. C. Tsoi, M. Hagenbuchner, G. Monfardini. The graph neural network model. IEEE Transactions on Neural Networks, vol. 20, no. 1, pp. 61\u201380, 2009. DOI: https:\/\/doi.org\/10.1109\/TNN.2008.2005605.","journal-title":"IEEE Transactions on Neural Networks"},{"key":"1274_CR82","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2010.5596796","volume-title":"Proceedings of International Joint Conference on Neural Networks","author":"C Gallicchio","year":"2010","unstructured":"C. Gallicchio, A. Micheli. Graph echo state networks. In Proceedings of International Joint Conference on Neural Networks, IEEE, Barcelona, Spain, 2010. DOI: https:\/\/doi.org\/10.1109\/IJCNN.2010.5596796."},{"key":"1274_CR83","unstructured":"J. Bruna, W. Zaremba, A. Szlam, Y. LeCun. Spectral networks and locally connected networks on graphs. In Proceedings of the 2nd International Conference on Learning Representations, Banff, Canada, 2013."},{"issue":"40","key":"1274_CR84","first-page":"1201","volume":"11","author":"S V N Vishwanathan","year":"2010","unstructured":"S. V. N. Vishwanathan, N. N. Schraudolph, R. Kondor, K. M. Borgwardt. Graph kernels. The Journal of Machine Learning Research, vol. 11, no. 40, pp. 1201\u20131242, 2010.","journal-title":"The Journal of Machine Learning Research"},{"key":"1274_CR85","doi-asserted-by":"publisher","first-page":"129","DOI":"10.1007\/978-3-540-45167-9_11","volume-title":"Proceedings of the 16th Annual Conference on Learning Theory and 7th Kernel Workshop on Learning Theory and Kernel Machines","author":"T Gartner","year":"2003","unstructured":"T. Gartner, P. Flach, S. Wrobel. On graph kernels: Hardness results and efficient alternatives. In Proceedings of the 16th Annual Conference on Learning Theory and 7th Kernel Workshop on Learning Theory and Kernel Machines, Springer, Washington, USA, pp. 129\u2013143, 2003. DOI: https:\/\/doi.org\/10.1007\/978-3-540-45167-9_11."},{"key":"1274_CR86","doi-asserted-by":"publisher","first-page":"541","DOI":"10.1007\/978-3-030-58536-5_32","volume-title":"Proceedings of the 16th European Conference on Computer Vision","author":"M Liang","year":"2020","unstructured":"M. Liang, B. Yang, R. Hu, Y. Chen, R. J. Liao, S. Feng, R. Urtasun. Learning lane graph representations for motion forecasting. In Proceedings of the 16th European Conference on Computer Vision, Springer, Glasgow, UK, pp. 541\u2013556, 2020. DOI: https:\/\/doi.org\/10.1007\/978-3-030-58536-5_32."},{"key":"1274_CR87","unstructured":"H. Y. Lee, L. Jiang, I. Essa, P. B. Le, H. F. Gong, M. H. Yang, W. L. Yang. Neural design network: Graphic layout generation with constraints. [Online], Available: https:\/\/arxiv.org\/abs\/1912.09421, 2019."},{"key":"1274_CR88","doi-asserted-by":"publisher","first-page":"379","DOI":"10.1007\/978-3-030-58571-6_23","volume-title":"Proceedings of the 16th European Conference on Computer Vision","author":"C Q Yu","year":"2020","unstructured":"C. Q. Yu, Y. F. Liu, C. X. Gao, C. H. Shen, N. Sang. Representative graph neural network. In Proceedings of the 16th European Conference on Computer Vision, Springer, Glasgow, UK, pp. 379\u2013396, 2020. DOI: https:\/\/doi.org\/10.1007\/978-3-030-58571-6_23."},{"key":"1274_CR89","doi-asserted-by":"publisher","unstructured":"M. T. Luong, H. Pham, C. D. Manning. Effective approaches to attention-based neural machine translation. In Proceedings of Conference on Empirical Methods in Natural Language Processing, Association for Computational Linguistics, Lisbon, Portugal, pp. 1412\u20131421, 2015. DOI: https:\/\/doi.org\/10.18653\/v1\/D15-1166.","DOI":"10.18653\/v1\/D15-1166"},{"key":"1274_CR90","unstructured":"A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, L. Kaiser, I. Polosukhin. Attention is all you need. In Proceedings of the 31st International Conference on Neural Information Processing Systems, Long Beach, USA, pp. 5998\u20136008, 2017."},{"key":"1274_CR91","doi-asserted-by":"crossref","unstructured":"Z. H. Dai, Z. L. Yang, Y. M. Yang, J. Carbonell, Q. V. Le, R. Salakhutdinov. Transformer-XL: Attentive language models beyond a fixed-length context. [Online], Available: https:\/\/arxiv.org\/abs\/1901.02860, 2019.","DOI":"10.18653\/v1\/P19-1285"},{"key":"1274_CR92","doi-asserted-by":"crossref","unstructured":"P. Shaw, J. Uszkoreit, A. Vaswani. Self-attention with relative position representations. [Online], Available: https:\/\/arxiv.org\/abs\/1803.02155, 2018.","DOI":"10.18653\/v1\/N18-2074"},{"key":"1274_CR93","doi-asserted-by":"publisher","unstructured":"X. Q. Zhang, T. Wang, J. X. Wang, G. Y. Tang, L. Zhao. Pyramid channel-based feature attention network for image dehazing. Computer Vision and Image Understanding, vol. 197\u2013198, Article number 103003, 2020. DOI: https:\/\/doi.org\/10.1016\/j.cviu.2020.103003.","DOI":"10.1016\/j.cviu.2020.103003"},{"key":"1274_CR94","unstructured":"K. Xu, J. L. Ba, R. Kiros, K. Cho, A. Courville, R. Salakhutdinov, R. S. Zemel, Y. Bengio. Show, attend and tell: Neural image caption generation with visual attention. In Proceedings of the 32nd International Conference on International Conference on Machine Learning, pp. 2048\u20132057, 2015."},{"key":"1274_CR95","doi-asserted-by":"publisher","first-page":"1316","DOI":"10.1109\/CV-PR.2018.00143","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"T Xu","year":"2018","unstructured":"T. Xu, P. C. Zhang, Q. Y. Huang, H. Zhang, Z. Gan, X. L. Huang, X. D. He. AttnGAN: Fine-grained text to image generation with attentional generative adversarial networks. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 1316\u20131324, 2018. DOI: https:\/\/doi.org\/10.1109\/CV-PR.2018.00143."},{"key":"1274_CR96","doi-asserted-by":"publisher","first-page":"3588","DOI":"10.1109\/CVPR.2018.00378","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"H Hu","year":"2018","unstructured":"H. Hu, J. Y. Gu, Z. Zhang, J. F. Dai, Y. C. Wei. Relation networks for object detection. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 3588\u20133597, 2018. DOI: https:\/\/doi.org\/10.1109\/CVPR.2018.00378."},{"key":"1274_CR97","doi-asserted-by":"publisher","first-page":"7794","DOI":"10.1109\/CVPR.2018.00813","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"X L Wang","year":"2018","unstructured":"X. L. Wang, R. Girshick, A. Gupta, K. M. He. Non-local neural networks. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 7794\u20137803, 2018. DOI: https:\/\/doi.org\/10.1109\/CVPR.2018.00813."},{"key":"1274_CR98","doi-asserted-by":"publisher","first-page":"408","DOI":"10.1109\/ICCV.2017.52","volume-title":"Proceedings of IEEE International Conference on Computer Vision","author":"X Z Zhu","year":"2017","unstructured":"X. Z. Zhu, Y. J. Wang, J. F. Dai, L. Yuan, Y. C. Wei. Flow-guided feature aggregation for video object detection. In Proceedings of IEEE International Conference on Computer Vision, IEEE, Venice, Italy, pp. 408\u2013417, 2017. DOI: https:\/\/doi.org\/10.1109\/ICCV.2017.52."},{"key":"1274_CR99","doi-asserted-by":"publisher","first-page":"485","DOI":"10.1007\/978-3-030-01237-3_30","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"F Y Xiao","year":"2018","unstructured":"F. Y. Xiao, Y. J. Lee. Video object detection with an aligned spatial-temporal memory. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 485\u2013501, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01237-3_30."},{"key":"1274_CR100","doi-asserted-by":"publisher","first-page":"4706","DOI":"10.1109\/CVPR42600.2020.00476","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"X H Jiang","year":"2020","unstructured":"X. H. Jiang, L. Zhang, M. L. Xu, T. Z. Zhang, P. Lv, B. Zhou, X. Yang, Y. W. Pang. Attention scaling for crowd counting. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 4706\u20134715, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00476."},{"key":"1274_CR101","unstructured":"H. Zhang, I. Goodfellow, D. Metaxas, A. Odena. Self-attention generative adversarial networks. In Proceedings of the 36th International Conference on Machine Learning, Long Beach, USA, pp. 7354\u20137363, 2019."},{"key":"1274_CR102","doi-asserted-by":"publisher","first-page":"11065","DOI":"10.1109\/CV-PR.2019.01132","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"T Dai","year":"2019","unstructured":"T. Dai, J. R. Cai, Y. B. Zhang, S. T. Xia, L. Zhang. Second-order attention network for single image superresolution. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 11065\u201311074, 2019. DOI: https:\/\/doi.org\/10.1109\/CV-PR.2019.01132."},{"key":"1274_CR103","doi-asserted-by":"publisher","first-page":"80","DOI":"10.1016\/j.patcog.2018.10.005","volume":"87","author":"B Y Chen","year":"2019","unstructured":"B. Y. Chen, P. X. Li, C. Sun, D. Wang, G. Yang, H. C. Lu. Multi attention module for visual tracking. Pattern Recognition, vol. 87, pp. 80\u201393, 2019. DOI: https:\/\/doi.org\/10.1016\/j.pat-cog.2018.10.005.","journal-title":"Pattern Recognition"},{"key":"1274_CR104","doi-asserted-by":"publisher","first-page":"8817","DOI":"10.1109\/CVPR.2018.00919","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Z X Wu","year":"2018","unstructured":"Z. X. Wu, T. Nagarajan, A. Kumar, S. Rennie, L. S. Davis, K. Grauman, R. Feris. BlockDrop: Dynamic inference paths in residual networks. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 8817\u20138826, 2018. DOI: https:\/\/doi.org\/10.1109\/CVPR.2018.00919."},{"key":"1274_CR105","doi-asserted-by":"publisher","first-page":"409","DOI":"10.1007\/978-3-030-01261-8_25","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"X Wang","year":"2018","unstructured":"X. Wang, F. S. Yu, Z. Y. Dou, T. Darrell, J. E. Gonzalez. SkipNet: Learning dynamic routing in convolutional networks. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 409\u2013424, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01261-8_25."},{"key":"1274_CR106","doi-asserted-by":"publisher","first-page":"8080","DOI":"10.1109\/CV-PR.2018.00843","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"N Shazeer","year":"2018","unstructured":"N. Shazeer, K. Fatahalian, W. R. Mark, R. T. Mullapudi. HydraNets: Specialized dynamic architectures for efficient inference. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 8080\u20138089, 2018. DOI: https:\/\/doi.org\/10.1109\/CV-PR.2018.00843."},{"key":"1274_CR107","unstructured":"G. Huang, D. L. Chen, T. H. Li, F. Wu, L. Van Der Maaten, K. Q. Weinberger. Multi-scale dense networks for resource efficient image classification. [Online], Available: https:\/\/arxiv.org\/abs\/1703.09844, 2017."},{"key":"1274_CR108","unstructured":"Z. H. You, K. Yan, J. M. Ye, M. Ma, P. Wang. Gate decorator: Global filter pruning method for accelerating deep convolutional neural networks. In Proceedings of the 33rd Conference on Neural Information Processing Systems, Vancouver, Canada, pp. 2133\u20132144, 2019."},{"key":"1274_CR109","doi-asserted-by":"publisher","first-page":"8553","DOI":"10.1109\/CVPR42600.2020.00858","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Y W Li","year":"2020","unstructured":"Y. W. Li, L. Song, Y. K. Chen, Z. M. Li, X. Y. Zhang, X. G. Wang, J. Sun. Learning dynamic routing for semantic segmentation. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 8553\u20138562, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00858."},{"key":"1274_CR110","unstructured":"B. De Brabandere, X. Jia, T. Tuytelaars, L. Van Gool. Dynamic filter networks. In Proceedings of the 30th Conference on Neural Information Processing Systems, Barcelona, Spain, pp. 667\u2013675, 2016."},{"key":"1274_CR111","doi-asserted-by":"publisher","first-page":"261","DOI":"10.1109\/ICCV.2017.37","volume-title":"Proceedings of IEEE International Conference on Computer Vision","author":"S Niklaus","year":"2017","unstructured":"S. Niklaus, L. Mai, F. Liu. Video frame interpolation via adaptive separable convolution. In Proceedings of IEEE International Conference on Computer Vision, IEEE, Venice, Italy, pp. 261\u2013270, 2017. DOI: https:\/\/doi.org\/10.1109\/ICCV.2017.37."},{"key":"1274_CR112","doi-asserted-by":"publisher","first-page":"3224","DOI":"10.1109\/CVPR.2018.00340","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Y Jo","year":"2018","unstructured":"Y. Jo, S. W. Oh, J. Kang, S. J. Kim. Deep video super-resolution network using dynamic upsampling filters without explicit motion compensation. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 3224\u20133232, 2018. DOI: https:\/\/doi.org\/10.1109\/CVPR.2018.00340."},{"key":"1274_CR113","unstructured":"X. Y. Xu, M. C. Li, W. X. Sun. Learning deformable kernels for image and video denoising. [Online], Available: https:\/\/arxiv.org\/abs\/1904.06903, 2019."},{"key":"1274_CR114","doi-asserted-by":"publisher","first-page":"2502","DOI":"10.1109\/CV-PR.2018.00265","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"B Mildenhall","year":"2018","unstructured":"B. Mildenhall, J. T. Barron, J. W. Chen, D. Sharlet, R. Ng, R. Carroll. Burst denoising with kernel prediction networks. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 2502\u20132510, 2018. DOI: https:\/\/doi.org\/10.1109\/CV-PR.2018.00265."},{"key":"1274_CR115","doi-asserted-by":"publisher","first-page":"12496","DOI":"10.1109\/CVPR42600.2020.01251","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Y S Xu","year":"2020","unstructured":"Y. S. Xu, S. Y. R. Tseng, Y. Tseng, H. K. Kuo, Y. M. Tsai. Unified dynamic convolutional network for super-resolution with variational degradations. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 12496\u201312505, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.01251."},{"key":"1274_CR116","doi-asserted-by":"publisher","first-page":"764","DOI":"10.1109\/ICCV.2017.89","volume-title":"Proceedings of IEEE International Conference on Computer Vision","author":"J F Dai","year":"2017","unstructured":"J. F. Dai, H. Z. Qi, Y. W. Xiong, Y. Li, G. D. Zhang, H. Hu, Y. C. Wei. Deformable convolutional networks. In Proceedings of IEEE International Conference on Computer Vision, IEEE, Venice, Italy, pp. 764\u2013773, 2017. DOI: https:\/\/doi.org\/10.1109\/ICCV.2017.89."},{"key":"1274_CR117","doi-asserted-by":"publisher","first-page":"9308","DOI":"10.1109\/CVPR.2019.00953","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"X Z Zhu","year":"2019","unstructured":"X. Z. Zhu, H. Hu, S. Lin, J. F. Dai. Deformable ConvNets V2: More deformable, better results. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 9308\u20139316, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00953."},{"key":"1274_CR118","unstructured":"C. F. Xu, B. C. Wu, Z. N. Wang, W. Zhan, P. Vajda, K. Keutzer, M. Tomizuka. SqueezeSegV3: Spatially-adaptive convolution for efficient point-cloud segmentation. [Online], Available: https:\/\/arxiv.org\/abs\/2004.01803, 2020."},{"key":"1274_CR119","doi-asserted-by":"publisher","first-page":"3992","DOI":"10.1109\/CVPR42600.2020.00405","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Z T Xiong","year":"2020","unstructured":"Z. T. Xiong, Y. Yuan, N. H. Guo, Q. Wang. Variational context-deformable convnets for indoor scene parsing. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 3992\u20134002, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00405."},{"issue":"9","key":"1274_CR120","doi-asserted-by":"publisher","first-page":"1659","DOI":"10.1016\/S0893-6080(97)00011-7","volume":"10","author":"W Maass","year":"1997","unstructured":"W. Maass. Networks of spiking neurons: The third generation of neural network models. Neural Networks, vol. 10, no. 9, pp. 1659\u20131671, 1997. DOI: https:\/\/doi.org\/10.1016\/S0893-6080(97)00011-7.","journal-title":"Neural Networks"},{"key":"1274_CR121","unstructured":"S. Kim, S. Park, B. Na, S. Yoon. Spiking-YOLO: Spiking neural network for energy-efficient object detection. [Online], Available: https:\/\/arxiv.org\/abs\/1903.06530, 2019."},{"issue":"5216","key":"1274_CR122","doi-asserted-by":"publisher","first-page":"1503","DOI":"10.1126\/science.7770778","volume":"268","author":"Z F Mainen","year":"1995","unstructured":"Z. F. Mainen, T. J. Sejnowski. Reliability of spike timing in neocortical neurons. Science, vol. 268, no. 5216, pp. 1503\u20131506, 1995. DOI: https:\/\/doi.org\/10.1126\/science.7770778.","journal-title":"Science"},{"key":"1274_CR123","first-page":"787","volume-title":"Proceedings of the 32nd International Conference on Neural Information Processing Systems","author":"G Bellec","year":"2018","unstructured":"G. Bellec, D. Salaj, A. Subramoney, R. Legenstein, W. Maass. Long short-term memory and learning-to-learn in networks of spiking neurons. In Proceedings of the 32nd International Conference on Neural Information Processing Systems, Curran Associates Inc., Red Hook, USA, pp. 787\u2013797, 2018."},{"issue":"1","key":"1274_CR124","doi-asserted-by":"publisher","first-page":"54","DOI":"10.1007\/s11263-014-0788-3","volume":"113","author":"Y Q Cao","year":"2015","unstructured":"Y. Q. Cao, Y. Chen, D. Khosla. Spiking deep convolutional neural networks for energy-efficient object recognition. International Journal of Computer Vision, vol. 113, no. 1, pp. 54\u201366, 2015. DOI: https:\/\/doi.org\/10.1007\/s11263-014-0788-3.","journal-title":"International Journal of Computer Vision"},{"key":"1274_CR125","doi-asserted-by":"publisher","first-page":"142","DOI":"10.1109\/CVPR.2000.854761","volume-title":"Proceedings IEEE Conference on Computer Vision and Pattern Recognition","author":"D Comaniciu","year":"2000","unstructured":"D. Comaniciu, V. Ramesh, P. Meer. Real-time tracking of non-rigid objects using mean shift. In Proceedings IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Hilton Head Island, USA, pp. 142\u2013149, 2000. DOI: https:\/\/doi.org\/10.1109\/CVPR.2000.854761."},{"key":"1274_CR126","doi-asserted-by":"publisher","first-page":"886","DOI":"10.1109\/CVPR.2005.177","volume-title":"Proceedings of IEEE Computer Society Conference on Computer Vision and Pattern Recognition","author":"N Dalal","year":"2005","unstructured":"N. Dalal, B. Triggs. Histograms of oriented gradients for human detection. In Proceedings of IEEE Computer Society Conference on Computer Vision and Pattern Recognition, IEEE, San Diego, USA, pp. 886\u2013893, 2005. DOI: https:\/\/doi.org\/10.1109\/CVPR.2005.177."},{"key":"1274_CR127","doi-asserted-by":"publisher","first-page":"702","DOI":"10.1007\/978-3-642-33765-9_50","volume-title":"Proceedings of the 12th European Conference on Computer Vision","author":"J F Henriques","year":"2012","unstructured":"J. F. Henriques, R. Caseiro, P. Martins, J. Batista. Exploiting the circulant structure of tracking-by-detection with kernels. In Proceedings of the 12th European Conference on Computer Vision, Springer, Florence, Italy, pp. 702\u2013715, 2012. DOI: https:\/\/doi.org\/10.1007\/978-3-642-33765-9_50."},{"issue":"3","key":"1274_CR128","doi-asserted-by":"publisher","first-page":"583","DOI":"10.1109\/TPAMI.2014.2345390","volume":"37","author":"J F Henriques","year":"2015","unstructured":"J. F. Henriques, R. Caseiro, P. Martins, J. Batista. Highspeed tracking with kernelized correlation filters. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 37, no. 3, pp. 583\u2013596, 2015. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2014.2345390.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1274_CR129","doi-asserted-by":"publisher","first-page":"1401","DOI":"10.1109\/CVPR.2016.156","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"L Bertinetto","year":"2016","unstructured":"L. Bertinetto, J. Valmadre, S. Golodetz, O. Miksik, P. H. S. Torr. Staple: Complementary learners for real-time tracking. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Las Vegas, USA, pp. 1401\u20131409, 2016. DOI: https:\/\/doi.org\/10.1109\/CVPR.2016.156."},{"key":"1274_CR130","doi-asserted-by":"publisher","first-page":"3074","DOI":"10.1109\/ICCV.2015.352","volume-title":"Proceedings of IEEE International Conference on Computer Vision","author":"C Ma","year":"2015","unstructured":"C. Ma, J. B. Huang, X. K. Yang, M. H. Yang. Hierarchical convolutional features for visual tracking. In Proceedings of IEEE International Conference on Computer Vision, IEEE, Santiago, Chile, pp. 3074\u20133082, 2015. DOI: https:\/\/doi.org\/10.1109\/ICCV.2015.352."},{"key":"1274_CR131","doi-asserted-by":"publisher","first-page":"4303","DOI":"10.1109\/CVPR.2016.466","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"Y K Qi","year":"2016","unstructured":"Y. K. Qi, S. P. Zhang, L. Qin, H. X. Yao, Q. M. Huang, J. Lim, M. H. Yang. Hedged deep tracking. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Las Vegas, USA, pp. 4303\u20134311, 2016. DOI: https:\/\/doi.org\/10.1109\/CVPR.2016.466."},{"key":"1274_CR132","doi-asserted-by":"publisher","first-page":"850","DOI":"10.1007\/978-3-319-48881-3_56","volume-title":"Proceedings of European Conference on Computer Vision","author":"L Bertinetto","year":"2016","unstructured":"L. Bertinetto, J. Valmadre, J. F. Henriques, A. Vedaldi, P. H. S. Torr. Fully-convolutional Siamese networks for object tracking. In Proceedings of European Conference on Computer Vision, Springer, Amsterdam, The Netherlands, pp. 850\u2013865, 2016. DOI: https:\/\/doi.org\/10.1007\/978-3-319-48881-3_56."},{"key":"1274_CR133","doi-asserted-by":"publisher","first-page":"4282","DOI":"10.1109\/CVPR.2019.00441","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"B Li","year":"2019","unstructured":"B. Li, W. Wu, Q. Wang, F. Y. Zhang, J. L. Xing, J. J. Yan. SiamRPN++: Evolution of Siamese visual tracking with very deep networks. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 4282\u20134291, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00441."},{"key":"1274_CR134","doi-asserted-by":"publisher","first-page":"7133","DOI":"10.1109\/CVPR42600.2020.00716","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"A Lukezic","year":"2020","unstructured":"A. Lukezic, J. Matas, M. Kristan. D3S-A discriminative single shot segmentation tracker. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 7133\u20137142, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00716."},{"key":"1274_CR135","doi-asserted-by":"publisher","first-page":"8355","DOI":"10.1109\/TIP.2020.3014952","volume":"29","author":"M Y Wu","year":"2020","unstructured":"M. Y. Wu, H. B. Ling, N. Bi, S. H. Gao, Q. Hu, H. Sheng, J. Y. Yu. Visual tracking with multiview trajectory prediction. IEEE Transactions on Image Processing, vol. 29, pp. 8355\u20138367, 2020. DOI: https:\/\/doi.org\/10.1109\/TIP.2020.3014952.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1274_CR136","doi-asserted-by":"publisher","first-page":"6668","DOI":"10.1109\/CVPR42600.2020.00670","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Z D Chen","year":"2020","unstructured":"Z. D. Chen, B. N. Zhong, G. R. Li, S. P. Zhang, R. R. Ji. Siamese box adaptive network for visual tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 6668\u20136677, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00670."},{"key":"1274_CR137","doi-asserted-by":"publisher","first-page":"4591","DOI":"10.1109\/CVPR.2019.00472","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Z P Zhang","year":"2019","unstructured":"Z. P. Zhang, H. W. Peng. Deeper and wider Siamese networks for real-time visual tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 4591\u20134600, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00472."},{"key":"1274_CR138","doi-asserted-by":"publisher","first-page":"36","DOI":"10.1016\/j.neucom.2020.02.080","volume":"401","author":"L Y Zheng","year":"2020","unstructured":"L. Y. Zheng, Y. Y. Chen, M. Tang, J. Q. Wang, H. Q. Lu. Siamese deformable cross-correlation network for realtime visual tracking. Neurocomputing, vol. 401, pp. 36\u201347, 2020. DOI: https:\/\/doi.org\/10.1016\/j.neucom.2020.02.080.","journal-title":"Neurocomputing"},{"key":"1274_CR139","doi-asserted-by":"publisher","first-page":"6728","DOI":"10.1109\/CVPR42600.2020.00676","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Y C Yu","year":"2020","unstructured":"Y. C. Yu, Y. L. Xiong, W. L. Huang, M. R. Scott. Deformable Siamese attention networks for visual object tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 6728\u20136737, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00676."},{"key":"1274_CR140","doi-asserted-by":"publisher","first-page":"1762","DOI":"10.1109\/TIP.2019.2942502","volume":"29","author":"Z Teng","year":"2019","unstructured":"Z. Teng, J. L. Xing, Q. Wang, B. P. Zhang, J. P. Fan. Deep spatial and temporal network for robust visual object tracking. IEEE Transactions on Image Processing, vol. 29, pp. 1762\u20131775, 2019. DOI: https:\/\/doi.org\/10.1109\/TIP.2019.2942502.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1274_CR141","doi-asserted-by":"publisher","first-page":"1479","DOI":"10.1109\/TIP.2019.2942506","volume":"29","author":"M H Abdelpakey","year":"2019","unstructured":"M. H. Abdelpakey, M. S. Shehata. DP-Siam: Dynamic policy Siamese network for robust object tracking. IEEE Transactions on Image Processing, vol. 29, pp. 1479\u20131492, 2019. DOI: https:\/\/doi.org\/10.1109\/TIP.2019.2942506.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1274_CR142","doi-asserted-by":"publisher","first-page":"6162","DOI":"10.1109\/ICCV.2019.00626","volume-title":"Proceedings of IEEE\/CVF International Conference on Computer Vision","author":"P X Li","year":"2019","unstructured":"P. X. Li, B. Y. Chen, W. L. Ouyang, D. Wang, X. Y. Yang, H. C. Lu. GradNet: Gradient-guided network for visual object tracking. In Proceedings of IEEE\/CVF International Conference on Computer Vision, IEEE, Seoul, Korea, pp. 6162\u20136171, 2019. DOI: https:\/\/doi.org\/10.1109\/ICCV.2019.00626."},{"key":"1274_CR143","doi-asserted-by":"publisher","first-page":"6269","DOI":"10.1109\/CVPR42600.2020.00630","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"D Y Guo","year":"2020","unstructured":"D. Y. Guo, J. Wang, Y. Cui, Z. H. Wang, S. Y. Chen. SiamCAR: Siamese fully convolutional classification and regression for visual tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 6269\u20136277, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00630."},{"key":"1274_CR144","doi-asserted-by":"publisher","first-page":"1328","DOI":"10.1109\/CVPR.2019.00142","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Q Wang","year":"2019","unstructured":"Q. Wang, L. Zhang, L. Bertinetto, W. M. Hu, P. H. S. Torr. Fast online object tracking and segmentation: A unifying approach. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 1328\u20131338, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00142."},{"key":"1274_CR145","doi-asserted-by":"publisher","first-page":"7952","DOI":"10.1109\/CVPR.2019.00814","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"H Fan","year":"2019","unstructured":"H. Fan, H. B. Ling. Siamese cascaded region proposal networks for real-time visual tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 7952\u20137961, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00814."},{"key":"1274_CR146","doi-asserted-by":"publisher","first-page":"483","DOI":"10.1007\/978-3-030-01216-8_30","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"G Bhat","year":"2018","unstructured":"G. Bhat, J. Johnander, M. Danelljan, F. S. Khan, M. Felsberg. Unveiling the power of deep tracking. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 483\u2013498, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01216-8_30."},{"key":"1274_CR147","doi-asserted-by":"publisher","first-page":"2610","DOI":"10.1109\/TIP.2019.2950508","volume":"29","author":"S M Ge","year":"2019","unstructured":"S. M. Ge, Z. Luo, C. H. Zhang, Y. Y. Hua, D. C. Tao. Distilling channels for efficient deep tracking. IEEE Transactions on Image Processing, vol. 29, pp. 2610\u20132621, 2019. DOI: https:\/\/doi.org\/10.1109\/TIP.2019.2950508.","journal-title":"IEEE Transactions on Image Processing"},{"issue":"7","key":"1274_CR148","doi-asserted-by":"publisher","first-page":"12549","DOI":"10.1609\/aaai.v34i07.6944","volume":"34","author":"Y D Xu","year":"2020","unstructured":"Y. D. Xu, Z. Y. Wang, Z. X. Li, Y. Ye, G. Yu. SiamFC++: Towards robust and accurate visual tracking with target estimation guidelines. In Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, no. 7, pp. 12549\u201312556, 2020. DOI: https:\/\/doi.org\/10.1609\/aaai.v34i07.6944.","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"issue":"7","key":"1274_CR149","doi-asserted-by":"publisher","first-page":"12645","DOI":"10.1609\/aaai.v34i07.6956","volume":"34","author":"Y Yang","year":"2020","unstructured":"Y. Yang, G. Li, Y. Qi, Q. Huang. Release the power of online-training for robust visual tracking. In Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, no. 7, pp. 12645\u201312652, 2020. DOI: https:\/\/doi.org\/10.1609\/aaai.v34i07.6956.","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"issue":"7","key":"1274_CR150","doi-asserted-by":"publisher","first-page":"13017","DOI":"10.1609\/aaai.v34i07.7002","volume":"34","author":"J H Zhou","year":"2020","unstructured":"J. H. Zhou, P. Wang, H. Y. Sun. Discriminative and robust online learning for Siamese visual tracking. In Proceedings of AAAI Conference on Artificial Intelligence, vol. 34, no. 7, AIAA, pp. 13017\u201313024, 2020.","journal-title":"Proceedings of AAAI Conference on Artificial Intelligence"},{"key":"1274_CR151","doi-asserted-by":"publisher","first-page":"479","DOI":"10.1109\/CVPR.2018.00057","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"J Choi","year":"2018","unstructured":"J. Choi, H. J. Chang, T. Fischer, S. Yun, K. Lee, J. Jeong, Y. Demiris, J. Y. Choi. Context-aware deep feature compression for high-speed visual tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 479\u2013488, 2018. DOI: https:\/\/doi.org\/10.1109\/CVPR.2018.00057."},{"key":"1274_CR152","doi-asserted-by":"publisher","first-page":"8971","DOI":"10.1109\/CVPR.2018.00935","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"B Li","year":"2018","unstructured":"B. Li, J. J. Yan, W. Wu, Z. Zhu, X. L. Hu. High performance visual tracking with Siamese region proposal network. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 8971\u20138980, 2018. DOI: https:\/\/doi.org\/10.1109\/CVPR.2018.00935."},{"key":"1274_CR153","doi-asserted-by":"publisher","first-page":"8990","DOI":"10.1109\/CVPR.2018.00937","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Y B Song","year":"2018","unstructured":"Y. B. Song, C. Ma, X. H. Wu, L. J. Gong, L. C. Bao, W. M. Zuo, C. H. Shen, R. W. H. Lau, M. H. Yang. Vital: Visual tracking via adversarial learning. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 8990\u20138999, 2018. DOI: https:\/\/doi.org\/10.1109\/CVPR.2018.00937."},{"key":"1274_CR154","doi-asserted-by":"publisher","unstructured":"Z. H. Lai, E. Lu, W. D. Xie. MAST: A memory-augmented self-supervised tracker. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 6479\u20136488 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00651.","DOI":"10.1109\/CVPR42600.2020.00651"},{"key":"1274_CR155","doi-asserted-by":"publisher","first-page":"569","DOI":"10.1007\/978-3-030-01219-9_35","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"E Park","year":"2018","unstructured":"E. Park, A. C. Berg. Meta-tracker: Fast and robust online adaptation for visual object trackers. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 569\u2013585, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01219-9_35."},{"key":"1274_CR156","doi-asserted-by":"publisher","first-page":"378","DOI":"10.1007\/978-3-030-58565-5_23","volume-title":"Proceedings of the 16th European Conference on Computer Vision","author":"X P Dong","year":"2020","unstructured":"X. P. Dong, J. B. Shen, L. Shao, F. Porikli. CLNet: A compact latent network for fast adjusting Siamese trackers. In Proceedings of the 16th European Conference on Computer Vision, Springer, Glasgow, UK, pp. 378\u2013395, 2020. DOI: https:\/\/doi.org\/10.1007\/978-3-030-58565-5_23."},{"key":"1274_CR157","doi-asserted-by":"publisher","first-page":"771","DOI":"10.1007\/978-3-030-58589-1_46","volume-title":"Proceedings of the 16th European Conference on Computer Vision","author":"Z P Zhang","year":"2020","unstructured":"Z. P. Zhang, H. W. Peng, J. L. Fu, B. Li, W. M. Hu. Ocean: Object-aware anchor-free tracking. In Proceedings of the 16th European Conference on Computer Vision, Springer, Glasgow, UK, pp. 771\u2013787, 2020. DOI: https:\/\/doi.org\/10.1007\/978-3-030-58589-1_46."},{"key":"1274_CR158","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/978-3-030-58542-6_1","volume-title":"Proceedings of the 16th European Conference on Computer Vision","author":"Y Liu","year":"2020","unstructured":"Y. Liu, R. T. Li, Y. Cheng, R. T. Tan, X. B. Sui. Object tracking using spatio-temporal networks for future prediction location. In Proceedings of the 16th European Conference on Computer Vision, Springer, Glasgow, UK, pp. 1\u201317, 2020. DOI: https:\/\/doi.org\/10.1007\/978-3-030-58542-6_1."},{"key":"1274_CR159","doi-asserted-by":"publisher","first-page":"429","DOI":"10.1007\/978-3-030-58542-6_26","volume-title":"Proceedings of the 16th European Conference on Computer Vision","author":"B Y Liao","year":"2020","unstructured":"B. Y. Liao, C. Y. Wang, Y. Y. Wang, Y. N. Wang, J. Yin. PG-Net: Pixel to global matching network for visual tracking. In Proceedings of the 16th European Conference on Computer Vision, Springer, Glasgow, UK, pp. 429\u2013444, 2020. DOI: https:\/\/doi.org\/10.1007\/978-3-030-58542-6_26."},{"key":"1274_CR160","doi-asserted-by":"publisher","first-page":"3999","DOI":"10.1109\/ICCV.2019.00410","volume-title":"Proceedings of IEEE\/CVF International Conference on Computer Vision","author":"L H Huang","year":"2019","unstructured":"L. H. Huang, X. Zhao, K. Q. Huang. Bridging the gap between detection and tracking: A unified approach. In Proceedings of IEEE\/CVF International Conference on Computer Vision, IEEE, Seoul, Korea, pp. 3999\u20134009, 2019. DOI: https:\/\/doi.org\/10.1109\/ICCV.2019.00410."},{"issue":"8","key":"1274_CR161","doi-asserted-by":"publisher","first-page":"3766","DOI":"10.1109\/TIP.2019.2902784","volume":"28","author":"W X Liu","year":"2019","unstructured":"W. X. Liu, Y. B. Song, D. S. Chen, S. F. He, Y. L. Yu, T. Yan, G. P. Hancke, R. W. H. Lau. Deformable object tracking with gated fusion. IEEE Transactions on Image Processing, vol. 28, no. 8, pp. 3766\u20133777, 2019. DOI: https:\/\/doi.org\/10.1109\/TIP.2019.2902784.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1274_CR162","doi-asserted-by":"publisher","first-page":"3351","DOI":"10.1109\/TIP.2019.2959256","volume":"29","author":"Z Y Liang","year":"2019","unstructured":"Z. Y. Liang, J. B. Shen. Local semantic Siamese networks for fast tracking. IEEE Transactions on Image Processing, vol. 29, pp. 3351\u20133364, 2019. DOI: https:\/\/doi.org\/10.1109\/TIP.2019.2959256.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1274_CR163","doi-asserted-by":"publisher","first-page":"4834","DOI":"10.1109\/CVPR.2018.00508","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"A F He","year":"2018","unstructured":"A. F. He, C. Luo, X. M. Tian, W. J. Zeng. A twofold Siamese network for real-time object tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Salt Lake City, USA, pp. 4834\u20134843, 2018. DOI: https:\/\/doi.org\/10.1109\/CVPR.2018.00508."},{"key":"1274_CR164","doi-asserted-by":"publisher","first-page":"4649","DOI":"10.1109\/CVPR.2019.00478","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"J Y Gao","year":"2019","unstructured":"J. Y. Gao, T. Z. Zhang, C. S. Xu. Graph convolutional tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 4649\u20134659, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00478."},{"key":"1274_CR165","doi-asserted-by":"publisher","first-page":"351","DOI":"10.1007\/978-3-030-01240-3_22","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"Y H Zhang","year":"2018","unstructured":"Y. H. Zhang, L. J. Wang, J. Q. Qi, D. Wang, M. Y. Feng, H. C. Lu. Structured Siamese network for real-time visual tracking. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 351\u2013366, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01240-3_22."},{"key":"1274_CR166","doi-asserted-by":"publisher","first-page":"3311","DOI":"10.1109\/TIP.2019.2959249","volume":"29","author":"K P Li","year":"2019","unstructured":"K. P. Li, Y. Kong, Y. Fu. Visual object tracking via multi-stream deep similarity learning networks. IEEE Transactions on Image Processing, vol. 29, pp. 3311\u20133320, 2019. DOI: https:\/\/doi.org\/10.1109\/TIP.2019.2959249.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1274_CR167","doi-asserted-by":"publisher","first-page":"6288","DOI":"10.1109\/CVPR42600.2020.00632","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"G T Wang","year":"2020","unstructured":"G. T. Wang, C. Luo, X. Y. Sun, Z. W. Xiong, W. J. Zeng. Tracking by instance detection: A meta-learning approach. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 6288\u20136297, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00632."},{"key":"1274_CR168","doi-asserted-by":"publisher","first-page":"6718","DOI":"10.1109\/CVPR42600.2020.00675","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"T Y Yang","year":"2020","unstructured":"T. Y. Yang, P. F. Xu, R. B. Hu, H. Chai, A. B. Chan. ROAM: Recurrently optimizing tracking model. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 6718\u20136727, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00675."},{"key":"1274_CR169","doi-asserted-by":"publisher","first-page":"353","DOI":"10.1007\/978-3-030-01264-9_22","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"X K Lu","year":"2018","unstructured":"X. K. Lu, C. Ma, B. B. Ni, X. K. Yang, I. Reid, M. H. Yang. Deep regression tracking with shrinkage loss. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 353\u2013369, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01264-9_22."},{"key":"1274_CR170","doi-asserted-by":"publisher","first-page":"822","DOI":"10.1007\/978-3-030-01270-0_50","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"H Z Zhou","year":"2018","unstructured":"H. Z. Zhou, B. Ummenhofer, T. Brox. DeepTAM: Deep tracking and mapping. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 822\u2013838, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01270-0_50."},{"key":"1274_CR171","doi-asserted-by":"publisher","first-page":"474","DOI":"10.1007\/978-3-030-58548-8_28","volume-title":"Proceedings of the 16th European Conference on Computer Vision","author":"X Y Zhou","year":"2020","unstructured":"X. Y. Zhou, V. Koltun, P. Krahenbuhl. Tracking objects as points. In Proceedings of the 16th European Conference on Computer Vision, Springer, Glasgow, UK, pp. 474\u2013490, 2020. DOI: https:\/\/doi.org\/10.1007\/978-3-030-58548-8_28."},{"issue":"8","key":"1274_CR172","doi-asserted-by":"publisher","first-page":"1084","DOI":"10.1007\/s11263-019-01156-6","volume":"127","author":"Y Sui","year":"2019","unstructured":"Y. Sui, Z. M. Zhang, G. H. Wang, Y. F. Tang, L. Zhang. Exploiting the anisotropy of correlation filter learning for visual tracking. International Journal of Computer Vision, vol. 127, no. 8, pp. 1084\u20131105, 2019. DOI: https:\/\/doi.org\/10.1007\/s11263-019-01156-6.","journal-title":"International Journal of Computer Vision"},{"issue":"3","key":"1274_CR173","doi-asserted-by":"publisher","first-page":"756","DOI":"10.1007\/s11263-019-01221-0","volume":"128","author":"H Z Zhou","year":"2020","unstructured":"H. Z. Zhou, B. Ummenhofer, T. Brox. DeepTAM: Deep tracking and mapping with convolutional neural networks. International Journal of Computer Vision, vol. 128, no. 3, pp. 756\u2013769, 2020. DOI: https:\/\/doi.org\/10.1007\/s11263-019-01221-0.","journal-title":"International Journal of Computer Vision"},{"key":"1274_CR174","doi-asserted-by":"publisher","unstructured":"L. H. Huang, X. Zhao, K. Q. Huang. GOT-10k: A large high-diversity benchmark for generic object tracking in the wild. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2019. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2019.2957464.","DOI":"10.1109\/TPAMI.2019.2957464"},{"key":"1274_CR175","doi-asserted-by":"publisher","first-page":"5374","DOI":"10.1109\/CVPR.2019.00552","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"H Fan","year":"2019","unstructured":"H. Fan, L. T. Lin, F. Yang, P. Chu, G. Deng, S. J. Yu, H. X. Bai, Y. Xu, C. Y. Liao, H. B. Ling. LaSOT: A high-quality benchmark for large-scale single object tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 5374\u20135383, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00552."},{"key":"1274_CR176","first-page":"191","volume-title":"Proceedings of the European Conference on Computer Vision","author":"M Kristan","year":"2014","unstructured":"M. Kristan, R. Pflugfelder, A. Leonardis, et al. The visual object tracking VOT2014 challenge results. In Proceedings of the European Conference on Computer Vision, Springer, Zurich, Switzerland, pp. 191\u2013217, 2014. DOI:10.1007\/978-3-319-16181-5_14."},{"issue":"9","key":"1274_CR177","doi-asserted-by":"publisher","first-page":"1834","DOI":"10.1109\/TPAMI.2014.2388226","volume":"37","author":"Y Wu","year":"2015","unstructured":"Y. Wu, J. Lim, M. H. Yang. Object tracking benchmark. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 37, no. 9, pp. 1834\u20131848, 2015. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2014.2388226.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1274_CR178","doi-asserted-by":"publisher","first-page":"1949","DOI":"10.1109\/ICCVW.2017.230","volume-title":"Proceedings of IEEE International Conference on Computer Vision Workshops","author":"M Kristan","year":"2017","unstructured":"M. Kristan, A. Leonardis, J. Matas, et al. The visual object tracking VOT2017 challenge results. In Proceedings of IEEE International Conference on Computer Vision Workshops, IEEE, Venice, Italy, pp. 1949\u20131972, 2017. DOI: https:\/\/doi.org\/10.1109\/ICCVW.2017.230."},{"key":"1274_CR179","doi-asserted-by":"publisher","first-page":"2206","DOI":"10.1109\/ICCVW.2019.00276","volume-title":"Proceedings of IEEE\/CVF International Conference on Computer Vision Workshop","author":"M Kristan","year":"2019","unstructured":"M. Kristan, J. Matas, A. Leonardis, et al. The seventh visual object tracking VOT2019 challenge results. In Proceedings of IEEE\/CVF International Conference on Computer Vision Workshop, IEEE, Seoul, Korea, pp. 2206\u20132241, 2019. DOI: https:\/\/doi.org\/10.1109\/ICCVW.2019.00276."},{"issue":"7","key":"1274_CR180","doi-asserted-by":"publisher","first-page":"1442","DOI":"10.1109\/TPAMI.2013.230","volume":"36","author":"A W M Smeulders","year":"2014","unstructured":"A. W. M. Smeulders, D. M. Chu, R. Cucchiara, S. Calderara, A. Dehghan, M. Shah. Visual tracking: An experimental survey. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 36, no. 7, pp. 1442\u20131468, 2014. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2013.230.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"2","key":"1274_CR181","doi-asserted-by":"publisher","first-page":"335","DOI":"10.1109\/TPAMI.2015.2417577","volume":"38","author":"A N Li","year":"2015","unstructured":"A. N. Li, M. Lin, Y. Wu, M. H. Yang, S. C. Yan. NUSPRO: A new visual tracking challenge. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 38, no. 2, pp. 335\u2013349, 2015. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2015.2417577.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"12","key":"1274_CR182","doi-asserted-by":"publisher","first-page":"5630","DOI":"10.1109\/TIP.2015.2482905","volume":"24","author":"P P Liang","year":"2015","unstructured":"P. P. Liang, E. Blasch, H. B. Ling. Encoding color information for visual tracking: Algorithms and benchmark. IEEE Transactions on Image Processing, vol. 24, no. 12, pp. 5630\u20135644, 2015. DOI: https:\/\/doi.org\/10.1109\/TIP.2015.2482905.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1274_CR183","doi-asserted-by":"publisher","first-page":"1125","DOI":"10.1109\/ICCV.2017.128","volume-title":"Proceedings of IEEE International Conference on Computer Vision","author":"H K Galoogahi","year":"2017","unstructured":"H. K. Galoogahi, A. Fagg, C. Huang, D. Ramanan, S. Lucey. Need for speed: A benchmark for higher frame rate object tracking. In Proceedings of IEEE International Conference on Computer Vision, IEEE, Venice, Italy, pp. 1125\u20131134, 2017. DOI: https:\/\/doi.org\/10.1109\/ICCV.2017.128."},{"key":"1274_CR184","doi-asserted-by":"publisher","first-page":"445","DOI":"10.1007\/978-3-319-46448-0_27","volume-title":"Proceedings of 14th European Conference on Computer Vision","author":"M Mueller","year":"2016","unstructured":"M. Mueller, N. Smith, B. Ghanem. A benchmark and simulator for UAV tracking. In Proceedings of 14th European Conference on Computer Vision, Springer, Amsterdam, The Netherlands, pp. 445\u2013461, 2016. DOI: https:\/\/doi.org\/10.1007\/978-3-319-46448-0_27."},{"key":"1274_CR185","doi-asserted-by":"publisher","first-page":"670","DOI":"10.1007\/978-3-030-01219-9_41","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"J Valmadre","year":"2018","unstructured":"J. Valmadre, L. Bertinetto, J. F. Henriques, R. Tao, A. Vedaldi, A. W. M. Smeulders, P. H. S. Torr, E. Gavves. Long-term tracking in the wild: A benchmark. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 670\u2013685, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01219-9_41."},{"key":"1274_CR186","doi-asserted-by":"publisher","first-page":"300","DOI":"10.1007\/978-3-030-01246-5_19","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"M Muller","year":"2018","unstructured":"M. Muller, A. Bibi, S. Giancola, S. Alsubaihi, B. Ghanem. TrackingNet: A large-scale dataset and benchmark for object tracking in the wild. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 300\u2013317, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01246-5_19."},{"key":"1274_CR187","unstructured":"L. Leal-Taixe, A. Milan, I. Reid, S. Roth, K. Schindler. Motchallenge 2015: Towards a benchmark for multi-target tracking. [Online], Available: https:\/\/arxiv.org\/abs\/1504.01942, 2015."},{"key":"1274_CR188","unstructured":"A. Milan, L. Leal-Taixe, I. Reid, S. Roth, K. Schindler. MOT16: A benchmark for multi-object tracking. [Online], Available: https:\/\/arxiv.org\/abs\/1603.00831, 2016."},{"key":"1274_CR189","doi-asserted-by":"publisher","first-page":"3354","DOI":"10.1109\/CVPR.2012.6248074","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"A Geiger","year":"2012","unstructured":"A. Geiger, P. Lenz, R. Urtasun. Are we ready for autonomous driving? The KITTI vision benchmark suite. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Providence, USA, pp. 3354\u20133361, 2012. DOI: https:\/\/doi.org\/10.1109\/CVPR.2012.6248074."},{"issue":"3","key":"1274_CR190","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"O. Russakovsky, J. Deng, H. Su, J. Krause, S. Satheesh, S. Ma, Z. H. Huang, A. Karpathy, A. Khosla, M. Bernstein, A. C. Berg, L. Fei-Fei. ImageNet large scale visual recognition challenge. International Journal of Computer Vision, vol. 115, no. 3, pp. 211\u2013252, 2015. DOI: https:\/\/doi.org\/10.1007\/s11263-015-0816-y.","journal-title":"International Journal of Computer Vision"},{"key":"1274_CR191","doi-asserted-by":"publisher","first-page":"5296","DOI":"10.1109\/CVPR.2017.789","volume-title":"Proceedings of IEEE Conference on Computer Vision and Pattern Recognition","author":"E Real","year":"2017","unstructured":"E. Real, J. Shlens, S. Mazzocchi, X. Pan, V. Vanhoucke. YouTube-boundingBoxes: A large high-precision human-annotated data set for object detection in video. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, IEEE, Honolulu, USA, pp. 5296\u20135305, 2017. DOI: https:\/\/doi.org\/10.1109\/CVPR.2017.789."},{"key":"1274_CR192","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/ICCVW.2015.79","volume-title":"Proceedings of IEEE International Conference on Computer Vision Workshop","author":"M Kristan","year":"2015","unstructured":"M. Kristan, J. Matas, A. Leonardis, M. Felsberg, L. Cehovin, G. Fernandez, T. Vojir, G. Hager, G. Nebehay, R. Pflugfelder, A. Gupta, A. Bibi, A. Lukezic, A. Garcia-Martin, A. Saffari, A. Petrosino, A. S. Montero. The visual object tracking VOT2015 challenge results. In Proceedings of IEEE International Conference on Computer Vision Workshop, IEEE, Santiago, Chile, pp. 1\u201323, 2015. DOI: https:\/\/doi.org\/10.1109\/ICCVW.2015.79."},{"key":"1274_CR193","doi-asserted-by":"publisher","first-page":"777","DOI":"10.1007\/978-3-319-48881-3_54","volume":"9914","author":"S Had","year":"2016","unstructured":"S. Had, R. Bowden, K. Lebeda. The visual object tracking VOT2016 challenge results. Lecture Notes in Computer Science, vol. 9914, pp. 777\u2013823, 2016.","journal-title":"Lecture Notes in Computer Science"},{"key":"1274_CR194","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1007\/978-3-030-11009-3_1","volume-title":"Proceedings of the European Conference on Computer Vision","author":"M Kristan","year":"2018","unstructured":"M. Kristan, A. Leonardis, J. Matas, et al. The sixth visual object tracking VOT2018 challenge results. In Proceedings of the European Conference on Computer Vision, Springer, Munich, Germany, pp. 3\u201353, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-11009-3_1."},{"key":"1274_CR195","volume-title":"WordNet: An Electronic Lexical Database","author":"G A Miller","year":"1998","unstructured":"G. A. Miller. WordNet: An Electronic Lexical Database. Cambridge, USA: MIT Press, 1998."},{"key":"1274_CR196","doi-asserted-by":"publisher","first-page":"1369","DOI":"10.1109\/CVPR.2019.00146","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"X Li","year":"2019","unstructured":"X. Li, C. Ma, B. Y. Wu, Z. Y. He, M. H. Yang. Targetaware deep tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, CA, USA, pp. 1369\u20131378, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00146."},{"key":"1274_CR197","doi-asserted-by":"publisher","first-page":"152","DOI":"10.1007\/978-3-030-01240-3_10","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"T Y Yang","year":"2018","unstructured":"T. Y. Yang, A. B. Chan. Learning dynamic memory networks for object tracking. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 152\u2013167, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01240-3_10."},{"key":"1274_CR198","doi-asserted-by":"publisher","first-page":"459","DOI":"10.1007\/978-3-030-01261-8_28","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"X P Dong","year":"2018","unstructured":"X. P. Dong, J. B. Shen. Triplet loss in Siamese network for object tracking. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 459\u2013474, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01261-8_28."},{"issue":"5","key":"1274_CR199","doi-asserted-by":"publisher","first-page":"515","DOI":"10.1007\/s11263-017-1049-z","volume":"126","author":"Y Sui","year":"2018","unstructured":"Y. Sui, Y. F. Tang, L. Zhang, G. H. Wang. Visual tracking via subspace learning: A discriminative approach. International Journal of Computer Vision, vol. 126, no. 5, pp. 515\u2013536, 2018. DOI: https:\/\/doi.org\/10.1007\/s11263-017-1049-z.","journal-title":"International Journal of Computer Vision"},{"issue":"11","key":"1274_CR200","doi-asserted-by":"publisher","first-page":"2709","DOI":"10.1109\/TPAMI.2018.2865311","volume":"41","author":"C Ma","year":"2019","unstructured":"C. Ma, J. B. Huang, X. K. Yang, M. H. Yang. Robust visual tracking via hierarchical convolutional features. IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 41, no. 11, pp. 2709\u20132723, 2019. DOI: https:\/\/doi.org\/10.1109\/TPAMI.2018.2865311.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1274_CR201","doi-asserted-by":"publisher","first-page":"1308","DOI":"10.1109\/CVPR.2019.00140","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"N Wang","year":"2019","unstructured":"N. Wang, Y. B. Song, C. Ma, W. G. Zhou, W. Liu, H. Q. Li. Unsupervised deep tracking. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, USA, pp. 1308\u20131317, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00140."},{"key":"1274_CR202","doi-asserted-by":"publisher","first-page":"6578","DOI":"10.1109\/CVPR42600.2020.00661","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"P Voigtlaender","year":"2020","unstructured":"P. Voigtlaender, J. Luiten, P. H. S. Torr, B. Leibe. Siam R-CNN: Visual tracking by re-detection. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, USA, pp. 6578\u20136588, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00661."},{"key":"1274_CR203","doi-asserted-by":"publisher","first-page":"101","DOI":"10.1007\/978-3-030-01240-3_7","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"Z Zhu","year":"2018","unstructured":"Z. Zhu, Q. Wang, B. Li, W. Wu, J. J. Yan, W. M. Hu. Distractor-aware Siamese networks for visual object tracking. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 101\u2013117, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01240-3_7."},{"key":"1274_CR204","doi-asserted-by":"publisher","first-page":"684","DOI":"10.1007\/978-3-030-01240-3_42","volume-title":"Proceedings of the 15th European Conference on Computer Vision","author":"L L Ren","year":"2018","unstructured":"L. L. Ren, X. Yuan, J. W. Lu, M. Yang, J. Zhou. Deep reinforcement learning with iterative shift for visual tracking. In Proceedings of the 15th European Conference on Computer Vision, Springer, Munich, Germany, pp. 684\u2013700, 2018. DOI: https:\/\/doi.org\/10.1007\/978-3-030-01240-3_42."},{"issue":"8","key":"1274_CR205","doi-asserted-by":"publisher","first-page":"4130","DOI":"10.1109\/TIP.2019.2904789","volume":"28","author":"H Fan","year":"2019","unstructured":"H. Fan, H. B. Ling. Parallel tracking and verifying. IEEE Transactions on Image Processing, vol. 28, no. 8, pp. 4130\u20134144, 2019. DOI: https:\/\/doi.org\/10.1109\/TIP.2019.2904789.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1274_CR206","doi-asserted-by":"publisher","first-page":"6182","DOI":"10.1109\/ICCV.2019.00628","volume-title":"Proceedings of IEEE\/CVF International Conference on Computer Vision","author":"G Bhat","year":"2019","unstructured":"G. Bhat, M. Danelljan, L. Van Gool, R. Timofte. Learning discriminative model prediction for tracking. In Proceedings of IEEE\/CVF International Conference on Computer Vision, IEEE, Seoul, Korea, pp. 6182\u20136191, 2019. DOI: https:\/\/doi.org\/10.1109\/ICCV.2019.00628."},{"key":"1274_CR207","doi-asserted-by":"publisher","first-page":"6298","DOI":"10.1109\/CVPR42600.2020.00633","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"K N Dai","year":"2020","unstructured":"K. N. Dai, Y. H. Zhang, D. Wang, J. H. Li, H. C. Lu, X. Y. Yang. High-performance long-term tracking with meta-updater. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Seattle, WA, USA, pp. 6298\u20136307, 2020. DOI: https:\/\/doi.org\/10.1109\/CVPR42600.2020.00633."},{"key":"1274_CR208","unstructured":"L. H. Huang, X. Zhao, K. Q. Huang. GlobalTrack: A simple and strong baseline for long-term tracking. [Online], Available: https:\/\/arxiv.org\/abs\/1912.08531, 2019."},{"key":"1274_CR209","doi-asserted-by":"publisher","first-page":"4660","DOI":"10.1109\/CVPR.2019.00479","volume-title":"Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"M Danelljan","year":"2019","unstructured":"M. Danelljan, G. Bhat, F. S. Khan, M. Felsberg. ATOM: Accurate tracking by overlap maximization. In Proceedings of IEEE\/CVF Conference on Computer Vision and Pattern Recognition, IEEE, Long Beach, CA, USA, pp. 4660\u20134669, 2019. DOI: https:\/\/doi.org\/10.1109\/CVPR.2019.00479."},{"key":"1274_CR210","doi-asserted-by":"publisher","first-page":"5138","DOI":"10.1109\/ICCV.2019.00524","volume-title":"Proceedings of IEEE\/CVF International Conference on Computer Vision","author":"J F Han","year":"2019","unstructured":"J. F. Han, P. Luo, X. G. Wang. Deep self-learning from noisy labels. In Proceedings of IEEE\/CVF International Conference on Computer Vision, IEEE, Seoul, Korea, pp. 5138\u20135147, 2019. DOI: https:\/\/doi.org\/10.1109\/ICCV.2019.00524."},{"issue":"4","key":"1274_CR211","doi-asserted-by":"publisher","first-page":"539","DOI":"10.1007\/s11633-020-1221-8","volume":"17","author":"F Q Liu","year":"2020","unstructured":"F. Q. Liu, Z. Y. Automatic \u201cground truth\u201d annotation and industrial workpiece dataset generation for deep learning. International Journal of Automation and Computing, vol. 17, no. 4, pp. 539\u2013550, 2020. DOI: https:\/\/doi.org\/10.1007\/s11633-020-1221-8.","journal-title":"International Journal of Automation and Computing"},{"issue":"6","key":"1274_CR212","doi-asserted-by":"publisher","first-page":"707","DOI":"10.1007\/s11633-019-1199-2","volume":"16","author":"Q Fu","year":"2019","unstructured":"Q. Fu, X. Y. Chen, W. A survey on 3D visual tracking of multicopters. International Journal of Automation and Computing, vol. 16, no. 6, pp. 707\u2013719, 2019. DOI: https:\/\/doi.org\/10.1007\/s11633-019-1199-2.","journal-title":"International Journal of Automation and Computing"}],"container-title":["International Journal of Automation and Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11633-020-1274-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11633-020-1274-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11633-020-1274-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,29]],"date-time":"2023-01-29T19:24:02Z","timestamp":1675020242000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11633-020-1274-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,3,4]]},"references-count":212,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2021,6]]}},"alternative-id":["1274"],"URL":"https:\/\/doi.org\/10.1007\/s11633-020-1274-8","relation":{},"ISSN":["1476-8186","1751-8520"],"issn-type":[{"value":"1476-8186","type":"print"},{"value":"1751-8520","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,3,4]]},"assertion":[{"value":"15 September 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 December 2020","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 March 2021","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}