{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T17:10:02Z","timestamp":1755882602836,"version":"3.44.0"},"publisher-location":"New York, NY, USA","reference-count":34,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,4,26]],"date-time":"2024-04-26T00:00:00Z","timestamp":1714089600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,4,26]]},"DOI":"10.1145\/3663976.3664032","type":"proceedings-article","created":{"date-parts":[[2024,6,27]],"date-time":"2024-06-27T18:25:58Z","timestamp":1719512758000},"page":"1-7","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Efficient Transformer-based Single-stage RGB-T Tracking with Larger Search Region and Acceleration Mechanism"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-6719-0238","authenticated-orcid":false,"given":"Jianqiang","family":"Xia","sequence":"first","affiliation":[{"name":"National Innovation Institute of Defense Technology, China and Intelligent Game and Decision Lab, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-6953-0626","authenticated-orcid":false,"given":"Xiaolei","family":"Wang","sequence":"additional","affiliation":[{"name":"Intelligent Game and Decision Lab, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8112-371X","authenticated-orcid":false,"given":"Dianxi","family":"Shi","sequence":"additional","affiliation":[{"name":"Intelligent Game and Decision Lab, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5959-0768","authenticated-orcid":false,"given":"Songchang","family":"Jin","sequence":"additional","affiliation":[{"name":"Intelligent Game and Decision Lab, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-6261-9585","authenticated-orcid":false,"given":"Chenran","family":"Zhao","sequence":"additional","affiliation":[{"name":"National University of Defense Technology, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-7385-7318","authenticated-orcid":false,"given":"Linna","family":"Song","sequence":"additional","affiliation":[{"name":"National University of Defense Technology, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-0027-7564","authenticated-orcid":false,"given":"Qianying","family":"Ouyang","sequence":"additional","affiliation":[{"name":"Intelligent Game and Decision Lab, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2024,6,27]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Semi-Automatic Annotation of Objects in Visual-Thermal Video. 2019 IEEE\/CVF International Conference on Computer Vision Workshop (ICCVW) (2019","author":"Berg Amanda","year":"2019","unstructured":"Amanda Berg, Joakim Johnander, Flavie\u00a0Durand de Gevigney, J\u00f6rgen Ahlberg, and Michael Felberg. 2019. Semi-Automatic Annotation of Objects in Visual-Thermal Video. 2019 IEEE\/CVF International Conference on Computer Vision Workshop (ICCVW) (2019), 2242\u20132251. https:\/\/api.semanticscholar.org\/CorpusID:207916879"},{"key":"e_1_3_2_1_2_1","volume-title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ArXiv abs\/2010.11929","author":"Dosovitskiy Alexey","year":"2020","unstructured":"Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, and Neil Houlsby. 2020. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ArXiv abs\/2010.11929 (2020). https:\/\/api.semanticscholar.org\/CorpusID:225039882"},{"key":"e_1_3_2_1_3_1","volume-title":"Deep Adaptive Fusion Network for High Performance RGBT Tracking. ICCVW","author":"Gao Yuan","year":"2019","unstructured":"Yuan Gao, Chenglong Li, Yabin Zhu, Jin Tang, Tao He, and Futian Wang. 2019. Deep Adaptive Fusion Network for High Performance RGBT Tracking. ICCVW (2019), 91\u201399. https:\/\/api.semanticscholar.org\/CorpusID:207905041"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6248074"},{"key":"e_1_3_2_1_5_1","volume-title":"MIRNet: A Robust RGBT Tracking Jointly with Multi-Modal Interaction and Refinement. ICME","author":"Hou Ruichao","year":"2022","unstructured":"Ruichao Hou, Tongwei Ren, and Gangshan Wu. 2022. MIRNet: A Robust RGBT Tracking Jointly with Multi-Modal Interaction and Refinement. ICME (2022), 1\u20136. https:\/\/api.semanticscholar.org\/CorpusID:251847868"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"crossref","unstructured":"Tianrui Hui Zizheng Xun Fengguang Peng Junshi Huang Xiaoming Wei Xiaolin Wei Jiao Dai Jizhong Han and Si Liu. 2023. Bridging Search Region Interaction With Template for RGB-T Tracking. In CVPR. 13630\u201313639.","DOI":"10.1109\/CVPR52729.2023.01310"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"crossref","unstructured":"Ilchae Jung Jeany Son Mooyeol Baek and Bohyung Han. 2018. Real-Time MDNet. In ECCV. https:\/\/api.semanticscholar.org\/CorpusID:52097928","DOI":"10.1007\/978-3-030-01225-0_6"},{"key":"e_1_3_2_1_8_1","volume-title":"The Seventh Visual Object Tracking VOT2019 Challenge Results. ICCVW (2019","author":"Kristan Matej","year":"2019","unstructured":"Matej Kristan, Jiri Matas, 2019. The Seventh Visual Object Tracking VOT2019 Challenge Results. ICCVW (2019), 2206\u20132241. https:\/\/api.semanticscholar.org\/CorpusID:207925044"},{"key":"e_1_3_2_1_9_1","first-page":"106977","article-title":"RGB-T object tracking: Benchmark and baseline","volume":"96","author":"Li Chenglong","year":"2019","unstructured":"Chenglong Li, Xinyan Liang, Yijuan Lu, Nan Zhao, and Jin Tang. 2019. RGB-T object tracking: Benchmark and baseline. PR 96 (2019), 106977.","journal-title":"PR"},{"volume-title":"Challenge-aware RGBT tracking","author":"Li Chenglong","key":"e_1_3_2_1_10_1","unstructured":"Chenglong Li, Lei Liu, Andong Lu, Qing Ji, and Jin Tang. 2020. Challenge-aware RGBT tracking. In ECCV. Springer, 222\u2013237."},{"key":"e_1_3_2_1_11_1","volume-title":"International Conference on Learning Representations. https:\/\/api.semanticscholar.org\/CorpusID:251647803","author":"Liang Youwei","year":"2022","unstructured":"Youwei Liang, Chongjian Ge, Zhan Tong, Yibing Song, Jue Wang, and Pengtao Xie. 2022. EViT: Expediting Vision Transformers via Token Reorganizations. In International Conference on Learning Representations. https:\/\/api.semanticscholar.org\/CorpusID:251647803"},{"key":"e_1_3_2_1_12_1","first-page":"5613","article-title":"RGBT Tracking via Multi-Adapter Network with Hierarchical Divergence Loss","volume":"30","author":"Lu Andong","year":"2020","unstructured":"Andong Lu, Chenglong Li, Y. Yan, Jin Tang, and Bin Luo. 2020. RGBT Tracking via Multi-Adapter Network with Hierarchical Divergence Loss. TIP 30 (2020), 5613\u20135625. https:\/\/api.semanticscholar.org\/CorpusID:226964999","journal-title":"TIP"},{"key":"e_1_3_2_1_13_1","first-page":"5613","article-title":"RGBT Tracking via Multi-Adapter Network with Hierarchical Divergence Loss","volume":"30","author":"Lu Andong","year":"2020","unstructured":"Andong Lu, Chenglong Li, Y. Yan, Jin Tang, and Bin Luo. 2020. RGBT Tracking via Multi-Adapter Network with Hierarchical Divergence Loss. TIP 30 (2020), 5613\u20135625. https:\/\/api.semanticscholar.org\/CorpusID:226964999","journal-title":"TIP"},{"key":"e_1_3_2_1_14_1","volume-title":"Duality-Gated Mutual Condition Network for RGBT Tracking. TNNLS PP","author":"Lu Andong","year":"2020","unstructured":"Andong Lu, Cun Qian, Chenglong Li, Jin Tang, and Liang Wang. 2020. Duality-Gated Mutual Condition Network for RGBT Tracking. TNNLS PP (2020). https:\/\/api.semanticscholar.org\/CorpusID:226965016"},{"key":"e_1_3_2_1_15_1","volume-title":"Object Tracking Algorithms for Video Surveillance Applications. 2018 International Conference on Communication and Signal Processing (ICCSP)","author":"Mangawati S","year":"2018","unstructured":"Akshay\u00a0S Mangawati, Mohana, Mohammed Leesan, and RAVISH ARADHYA\u00a0H V. 2018. Object Tracking Algorithms for Video Surveillance Applications. 2018 International Conference on Communication and Signal Processing (ICCSP) (2018), 0667\u20130671. https:\/\/api.semanticscholar.org\/CorpusID:53287883"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.1109\/JSEN.2023.3244834"},{"key":"e_1_3_2_1_17_1","volume-title":"Learning Multi-domain Convolutional Neural Networks for Visual Tracking. CVPR","author":"Nam Hyeonseob","year":"2015","unstructured":"Hyeonseob Nam and Bohyung Han. 2015. Learning Multi-domain Convolutional Neural Networks for Visual Tracking. CVPR (2015), 4293\u20134302. https:\/\/api.semanticscholar.org\/CorpusID:973101"},{"key":"e_1_3_2_1_18_1","volume-title":"DynamicViT: Efficient Vision Transformers with Dynamic Token Sparsification. ArXiv abs\/2106.02034","author":"Rao Yongming","year":"2021","unstructured":"Yongming Rao, Wenliang Zhao, Benlin Liu, Jiwen Lu, Jie Zhou, and Cho-Jui Hsieh. 2021. DynamicViT: Efficient Vision Transformers with Dynamic Token Sparsification. ArXiv abs\/2106.02034 (2021). https:\/\/api.semanticscholar.org\/CorpusID:235313562"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3125504"},{"key":"e_1_3_2_1_20_1","volume-title":"Cross-Modal Pattern-Propagation for RGB-T Tracking. CVPR","author":"Wang Chaoqun","year":"2020","unstructured":"Chaoqun Wang, Chunyan Xu, Zhen Cui, Lingli Zhou, Tong Zhang, Xiaoya Zhang, and Jian Yang. 2020. Cross-Modal Pattern-Propagation for RGB-T Tracking. CVPR (2020), 7062\u20137071. https:\/\/api.semanticscholar.org\/CorpusID:220067013"},{"key":"e_1_3_2_1_21_1","volume-title":"MFGNet: Dynamic Modality-Aware Filter Generation for RGB-T Tracking. ArXiv abs\/2107.10433","author":"Wang Xiao","year":"2021","unstructured":"Xiao Wang, Xiu Shu, Shiliang Zhang, Bo Jiang, Yaowei Wang, Yonghong Tian, and Feng Wu. 2021. MFGNet: Dynamic Modality-Aware Filter Generation for RGB-T Tracking. ArXiv abs\/2107.10433 (2021). https:\/\/api.semanticscholar.org\/CorpusID:236171107"},{"key":"e_1_3_2_1_22_1","volume-title":"Ke Song, Linna Song, Xiaolei Wang, Songchang Jin, Li Zhou, Yu Cheng, Lei Jin, Zhengyu Zhu, Jianan Li, Gang Wang, Junliang Xing, and Jian Zhao.","author":"Xia Jianqiang","year":"2023","unstructured":"Jianqiang Xia, Dian xi Shi, Ke Song, Linna Song, Xiaolei Wang, Songchang Jin, Li Zhou, Yu Cheng, Lei Jin, Zhengyu Zhu, Jianan Li, Gang Wang, Junliang Xing, and Jian Zhao. 2023. Unified Single-Stage Transformer Network for Efficient RGB-T Tracking. ArXiv abs\/2308.13764 (2023). https:\/\/api.semanticscholar.org\/CorpusID:261242616"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"crossref","unstructured":"Yun Xiao Mengmeng Yang Chenglong Li Lei Liu and Jin Tang. 2022. Attribute-Based Progressive Fusion Network for RGBT Tracking. In AAAI. https:\/\/api.semanticscholar.org\/CorpusID:250303072","DOI":"10.1609\/aaai.v36i3.20187"},{"volume-title":"Joint feature learning and relation modeling for tracking: A one-stream framework","author":"Ye Botao","key":"e_1_3_2_1_24_1","unstructured":"Botao Ye, Hong Chang, Bingpeng Ma, Shiguang Shan, and Xilin Chen. 2022. Joint feature learning and relation modeling for tracking: A one-stream framework. In ECCV. Springer, 341\u2013357."},{"key":"e_1_3_2_1_25_1","volume-title":"A-ViT: Adaptive Tokens for Efficient Vision Transformer. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Yin Hongxu","year":"2021","unstructured":"Hongxu Yin, Arash Vahdat, Jos\u00e9\u00a0Manuel \u00c1lvarez, Arun Mallya, Jan Kautz, and Pavlo Molchanov. 2021. A-ViT: Adaptive Tokens for Efficient Vision Transformer. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2021), 10799\u201310808. https:\/\/api.semanticscholar.org\/CorpusID:245131572"},{"key":"e_1_3_2_1_26_1","volume-title":"Joost van\u00a0de Weijer, and Fahad\u00a0Shahbaz Khan","author":"Zhang Lichao","year":"2019","unstructured":"Lichao Zhang, Martin Danelljan, Abel Gonzalez-Garcia, Joost van\u00a0de Weijer, and Fahad\u00a0Shahbaz Khan. 2019. Multi-Modal Fusion for End-to-End RGB-T Tracking. ICCVW (2019), 2252\u20132261. https:\/\/api.semanticscholar.org\/CorpusID:201698179"},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-021-01495-3"},{"key":"e_1_3_2_1_28_1","first-page":"3335","article-title":"Jointly Modeling Motion and Appearance Cues for Robust RGB-T Tracking","volume":"30","author":"Zhang Pengyu","year":"2020","unstructured":"Pengyu Zhang, Jie Zhao, Chunjuan Bo, Dong Wang, Huchuan Lu, and Xiaoyun Yang. 2020. Jointly Modeling Motion and Appearance Cues for Robust RGB-T Tracking. TIP 30 (2020), 3335\u20133347. https:\/\/api.semanticscholar.org\/CorpusID:220364434","journal-title":"TIP"},{"key":"e_1_3_2_1_29_1","volume-title":"Visible-Thermal UAV Tracking: A Large-Scale Benchmark and New Baseline. CVPR","author":"Zhang Pengyu","year":"2022","unstructured":"Pengyu Zhang, Jie Zhao, D. Wang, Huchuan Lu, and Xiang Ruan. 2022. Visible-Thermal UAV Tracking: A Large-Scale Benchmark and New Baseline. CVPR (2022), 8876\u20138885. https:\/\/api.semanticscholar.org\/CorpusID:248069388"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"crossref","unstructured":"Tianlu Zhang Hongyuan Guo Qiang Jiao Qiang Zhang and Jungong Han. 2023. Efficient RGB-T Tracking via Cross-Modality Distillation. In CVPR. 5404\u20135413.","DOI":"10.1109\/CVPR52729.2023.00523"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3072207"},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"crossref","unstructured":"Jiawen Zhu Simiao Lai Xin Chen Dong Wang and Huchuan Lu. 2023. Visual prompt multi-modal tracking. In CVPR. 9516\u20139526.","DOI":"10.1109\/CVPR52729.2023.00918"},{"key":"e_1_3_2_1_33_1","volume-title":"Dense Feature Aggregation and Pruning for RGBT Tracking. ACM MM","author":"Zhu Yabin","year":"2019","unstructured":"Yabin Zhu, Chenglong Li, Bin Luo, Jin Tang, and Xiao Wang. 2019. Dense Feature Aggregation and Pruning for RGBT Tracking. ACM MM (2019). https:\/\/api.semanticscholar.org\/CorpusID:198229527"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3067997"}],"event":{"name":"CVIPPR 2024: 2024 2nd Asia Conference on Computer Vision, Image Processing and Pattern Recognition","acronym":"CVIPPR 2024","location":"Xiamen China"},"container-title":["Proceedings of the 2024 2nd Asia Conference on Computer Vision, Image Processing and Pattern Recognition"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3663976.3664032","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3663976.3664032","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T16:29:28Z","timestamp":1755880168000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3663976.3664032"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,4,26]]},"references-count":34,"alternative-id":["10.1145\/3663976.3664032","10.1145\/3663976"],"URL":"https:\/\/doi.org\/10.1145\/3663976.3664032","relation":{},"subject":[],"published":{"date-parts":[[2024,4,26]]},"assertion":[{"value":"2024-06-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}