{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,17]],"date-time":"2026-06-17T23:53:35Z","timestamp":1781740415547,"version":"3.54.5"},"reference-count":87,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100004826","name":"Natural Science Foundation of Beijing Municipality","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004826","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100016103","name":"Communist Party of China Beijing Municipal Committee","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100016103","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Expert Systems with Applications"],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1016\/j.eswa.2026.132426","type":"journal-article","created":{"date-parts":[[2026,4,11]],"date-time":"2026-04-11T08:29:13Z","timestamp":1775896153000},"page":"132426","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["HATrack: Cross-modal fusion RGBT tracking with heterogeneous adapter"],"prefix":"10.1016","volume":"323","author":[{"given":"Shengbo","family":"Wang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yunfeng","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4125-4045","authenticated-orcid":false,"given":"Lei","family":"Deng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guangkai","family":"Sun","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mingli","family":"Dong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lianqing","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"11","key":"10.1016\/j.eswa.2026.132426_bib0001","doi-asserted-by":"crossref","first-page":"1947","DOI":"10.3390\/s16111947","article-title":"Context-aware fusion of RGB and thermal imagery for traffic monitoring","volume":"16","author":"Alldieck","year":"2016","journal-title":"Sensors"},{"key":"10.1016\/j.eswa.2026.132426_bib0002","doi-asserted-by":"crossref","DOI":"10.1016\/j.infrared.2023.104819","article-title":"Learning modality feature fusion via transformer for RGBT-tracking","volume":"133","author":"Cai","year":"2023","journal-title":"Infrared Physics & Technology"},{"key":"10.1016\/j.eswa.2026.132426_bib0003","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"927","article-title":"Bi-directional adapter for multimodal tracking","volume":"vol. 38","author":"Cao","year":"2024"},{"key":"10.1016\/j.eswa.2026.132426_bib0004","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"4766","article-title":"Smstracker: Tri-path score mask sigma fusion for multi-modal tracking","author":"Chan","year":"2025"},{"key":"10.1016\/j.eswa.2026.132426_bib0005","doi-asserted-by":"crossref","DOI":"10.1016\/j.infrared.2024.105310","article-title":"Highly compact adaptive network based on transformer for RGBT tracking","volume":"139","author":"Chen","year":"2024","journal-title":"Infrared Physics & Technology"},{"issue":"11","key":"10.1016\/j.eswa.2026.132426_bib0006","doi-asserted-by":"crossref","first-page":"12994","DOI":"10.1109\/TII.2024.3431044","article-title":"EF-DETR: A lightweight transformer-based object detector with an encoder-free neck","volume":"20","author":"Cheng","year":"2024","journal-title":"IEEE Transactions on Industrial Informatics"},{"issue":"11","key":"10.1016\/j.eswa.2026.132426_bib0007","doi-asserted-by":"crossref","first-page":"12878","DOI":"10.1109\/TPAMI.2022.3200245","article-title":"Transfuser: Imitation with transformer-based sensor fusion for autonomous driving","volume":"45","author":"Chitta","year":"2022","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"10.1016\/j.eswa.2026.132426_bib0008","doi-asserted-by":"crossref","first-page":"3378","DOI":"10.1109\/TMM.2023.3310295","article-title":"Learning multi-layer attention aggregation siamese network for robust RGBT tracking","volume":"26","author":"Feng","year":"2023","journal-title":"IEEE Transactions on Multimedia"},{"issue":"6","key":"10.1016\/j.eswa.2026.132426_bib0009","doi-asserted-by":"crossref","first-page":"1357","DOI":"10.23919\/JSEE.2023.000168","article-title":"A content-aware correlation filter with multi-feature fusion for RGB-T tracking","volume":"35","author":"Feng","year":"2024","journal-title":"Journal of Systems Engineering and Electronics"},{"key":"10.1016\/j.eswa.2026.132426_bib0010","doi-asserted-by":"crossref","unstructured":"Gao, L., Zhang, Y., Chen, L., Jiang, Y., Xie, W., & Li, Y. (2025a). Hyperspectral adapter for object tracking based on hyperspectral video. arXiv preprint arXiv: 2503.22199.","DOI":"10.2139\/ssrn.5282336"},{"key":"10.1016\/j.eswa.2026.132426_bib0011","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision workshops","article-title":"Deep adaptive fusion network for high performance RGBT tracking","author":"Gao","year":"2019"},{"key":"10.1016\/j.eswa.2026.132426_bib0012","article-title":"RAMR: A role-adaptive modality recalibration network for RGBT tracking","volume":"297","author":"Gao","year":"2025","journal-title":"Expert Systems with Applications"},{"issue":"18","key":"10.1016\/j.eswa.2026.132426_bib0013","doi-asserted-by":"crossref","first-page":"25888","DOI":"10.1007\/s11227-024-06443-9","article-title":"SiamMGT: Robust RGBT tracking via graph attention and reliable modality weight learning","volume":"80","author":"Geng","year":"2024","journal-title":"The Journal of Supercomputing"},{"issue":"7","key":"10.1016\/j.eswa.2026.132426_bib0014","doi-asserted-by":"crossref","first-page":"5519","DOI":"10.1109\/TCSVT.2024.3352573","article-title":"Knowledge synergy learning for multi-modal tracking","volume":"34","author":"He","year":"2024","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"10.1016\/j.eswa.2026.132426_bib0015","unstructured":"Hendrycks, D. (2016). Gaussian error linear units (gelus). arXiv preprint arXiv: 1606.08415."},{"key":"10.1016\/j.eswa.2026.132426_bib0016","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"19079","article-title":"Onetracker: Unifying visual object tracking with foundation models and efficient tuning","author":"Hong","year":"2024"},{"key":"10.1016\/j.eswa.2026.132426_bib0017","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"26551","article-title":"SDStrack: Self-distillation symmetric adapter learning for multi-modal visual object tracking","author":"Hou","year":"2024"},{"issue":"1","key":"10.1016\/j.eswa.2026.132426_bib0018","first-page":"550","article-title":"AlignSeg: Feature-aligned segmentation networks","volume":"44","author":"Huang","year":"2021","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"10.1016\/j.eswa.2026.132426_bib0019","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"13630","article-title":"Bridging search region interaction with template for RGB-T tracking","author":"Hui","year":"2023"},{"key":"10.1016\/j.eswa.2026.132426_bib0020","series-title":"2023 IEEE international conference on image processing (ICIP)","first-page":"510","article-title":"Robust RGB-T tracking via consistency regulated scene perception","author":"Kang","year":"2023"},{"issue":"12","key":"10.1016\/j.eswa.2026.132426_bib0021","doi-asserted-by":"crossref","first-page":"12692","DOI":"10.1109\/TCSVT.2025.3586106","article-title":"No-reference image quality assessment: Exploring intrinsic distortion characteristics via generative noise estimation with mamba","volume":"35","author":"Lan","year":"2025","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"issue":"1","key":"10.1016\/j.eswa.2026.132426_bib0022","doi-asserted-by":"crossref","first-page":"303","DOI":"10.1109\/TBC.2025.3609055","article-title":"Image quality assessment: Exploring the similarity of deep features via covariance-constrained spectra","volume":"72","author":"Lang","year":"2025","journal-title":"IEEE Transactions on Broadcasting"},{"issue":"12","key":"10.1016\/j.eswa.2026.132426_bib0023","doi-asserted-by":"crossref","first-page":"5743","DOI":"10.1109\/TIP.2016.2614135","article-title":"Learning collaborative sparse representation for grayscale-thermal tracking","volume":"25","author":"Li","year":"2016","journal-title":"IEEE Transactions on Image Processing"},{"key":"10.1016\/j.eswa.2026.132426_bib0024","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2019.106977","article-title":"RGB-T object tracking: Benchmark and baseline","volume":"96","author":"Li","year":"2019","journal-title":"Pattern Recognition"},{"key":"10.1016\/j.eswa.2026.132426_bib0025","series-title":"European conference on computer vision","first-page":"222","article-title":"Challenge-aware RGBT tracking","author":"Li","year":"2020"},{"key":"10.1016\/j.eswa.2026.132426_bib0026","doi-asserted-by":"crossref","first-page":"392","DOI":"10.1109\/TIP.2021.3130533","article-title":"Lasher: A large-scale high-diversity benchmark for RGBT tracking","volume":"31","author":"Li","year":"2021","journal-title":"IEEE Transactions on Image Processing"},{"key":"10.1016\/j.eswa.2026.132426_bib0027","series-title":"Proceedings of the 25th ACM international conference on multimedia","first-page":"1856","article-title":"Weighted sparse representation regularized graph learning for RGB-T object tracking","author":"Li","year":"2017"},{"key":"10.1016\/j.eswa.2026.132426_bib0028","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2024.112860","article-title":"MKFTracker: An RGBT tracker via multimodal knowledge embedding and feature interaction","volume":"310","author":"Li","year":"2025","journal-title":"Knowledge-Based Systems"},{"issue":"4","key":"10.1016\/j.eswa.2026.132426_bib0029","doi-asserted-by":"crossref","first-page":"2779","DOI":"10.1007\/s13042-024-02420-z","article-title":"FADSiamNet: Feature affinity drift siamese network for RGB-T target tracking","volume":"16","author":"Li","year":"2025","journal-title":"International Journal of Machine Learning and Cybernetics"},{"issue":"06","key":"10.1016\/j.eswa.2026.132426_bib0030","doi-asserted-by":"crossref","DOI":"10.1142\/S0218001422510089","article-title":"Multi-modal sparse tracking by jointing timing and modal consistency","volume":"36","author":"Li","year":"2022","journal-title":"International Journal of Pattern Recognition and Artificial Intelligence"},{"issue":"23","key":"10.1016\/j.eswa.2026.132426_bib0031","doi-asserted-by":"crossref","first-page":"4721","DOI":"10.3390\/electronics13234721","article-title":"DusiamIE: A lightweight multidimensional infrared-enhanced RGBT tracking algorithm for edge device deployment","volume":"13","author":"Li","year":"2024","journal-title":"Electronics"},{"key":"10.1016\/j.eswa.2026.132426_bib0032","series-title":"European conference on computer vision","first-page":"775","article-title":"Semantic flow for fast and accurate scene parsing","author":"Li","year":"2020"},{"key":"10.1016\/j.eswa.2026.132426_bib0033","doi-asserted-by":"crossref","unstructured":"Li, Y., Wang, B., & Li, Y. (2025c). LightFC-x: Lightweight convolutional tracker for RGB-x tracking. arXiv preprint arXiv: 2502.18143.","DOI":"10.1016\/j.knosys.2026.116107"},{"issue":"15","key":"10.1016\/j.eswa.2026.132426_bib0034","doi-asserted-by":"crossref","first-page":"28891","DOI":"10.1109\/JSEN.2025.3579339","article-title":"Transformer-based RGB-T tracking with channel and spatial feature fusion","volume":"25","author":"Li","year":"2025","journal-title":"IEEE Sensors Journal"},{"key":"10.1016\/j.eswa.2026.132426_bib0035","doi-asserted-by":"crossref","DOI":"10.1016\/j.oceaneng.2023.115449","article-title":"Underwater object tracker: UOSTrack for marine organism grasping of underwater vehicles","volume":"285","author":"Li","year":"2023","journal-title":"Ocean Engineering"},{"issue":"3","key":"10.1016\/j.eswa.2026.132426_bib0036","doi-asserted-by":"crossref","first-page":"2260","DOI":"10.1109\/TCSVT.2024.3497214","article-title":"RGB-sonar tracking benchmark and spatial cross-attention transformer tracker","volume":"35","author":"Li","year":"2024","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"issue":"2","key":"10.1016\/j.eswa.2026.132426_bib0037","doi-asserted-by":"crossref","first-page":"724","DOI":"10.1109\/TCSVT.2023.3288853","article-title":"Online learning samples and adaptive recovery for robust RGB-T tracking","volume":"34","author":"Liu","year":"2023","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"10.1016\/j.eswa.2026.132426_bib0038","doi-asserted-by":"crossref","first-page":"1753","DOI":"10.1109\/TIP.2024.3371355","article-title":"RGBT tracking via challenge-based appearance disentanglement and interaction","volume":"33","author":"Liu","year":"2024","journal-title":"IEEE Transactions on Image Processing"},{"key":"10.1016\/j.eswa.2026.132426_bib0039","series-title":"Proceedings of the 31st ACM international conference on multimedia","first-page":"3129","article-title":"Quality-aware RGBT tracking via supervised reliability learning and weighted residual guidance","author":"Liu","year":"2023"},{"key":"10.1016\/j.eswa.2026.132426_bib0040","doi-asserted-by":"crossref","first-page":"344","DOI":"10.1109\/TMM.2025.3623526","article-title":"Scale-aware attention and multi-modal prompt learning with fusion adapter for RGBT tracking","volume":"28","author":"Liu","year":"2025","journal-title":"IEEE Transactions on Multimedia"},{"key":"10.1016\/j.eswa.2026.132426_bib0041","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2025.112983","article-title":"Two-stage unidirectional fusion network for RGBT tracking","volume":"310","author":"Liu","year":"2025","journal-title":"Knowledge-Based Systems"},{"issue":"11","key":"10.1016\/j.eswa.2026.132426_bib0042","doi-asserted-by":"crossref","first-page":"18520","DOI":"10.1109\/JSEN.2024.3386772","article-title":"Specific and collaborative representations siamese network for RGBT tracking","volume":"24","author":"Liu","year":"2024","journal-title":"IEEE Sensors Journal"},{"key":"10.1016\/j.eswa.2026.132426_bib0043","unstructured":"Loshchilov, I., & Hutter, F. (2017). Decoupled weight decay regularization. arXiv preprint arXiv: 1711.05101."},{"key":"10.1016\/j.eswa.2026.132426_bib0044","doi-asserted-by":"crossref","first-page":"5613","DOI":"10.1109\/TIP.2021.3087341","article-title":"RGBT tracking via multi-adapter network with hierarchical divergence loss","volume":"30","author":"Lu","year":"2021","journal-title":"IEEE Transactions on Image Processing"},{"issue":"5","key":"10.1016\/j.eswa.2026.132426_bib0045","doi-asserted-by":"crossref","first-page":"2599","DOI":"10.1007\/s11263-024-02311-4","article-title":"Modality-missing RGBT tracking: Invertible prompt learning and high-quality benchmarks","volume":"133","author":"Lu","year":"2025","journal-title":"International Journal of Computer Vision"},{"issue":"3","key":"10.1016\/j.eswa.2026.132426_bib0046","doi-asserted-by":"crossref","first-page":"4118","DOI":"10.1109\/TNNLS.2022.3157594","article-title":"Duality-gated mutual condition network for RGBT tracking","volume":"36","author":"Lu","year":"2022","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"issue":"03","key":"10.1016\/j.eswa.2026.132426_bib0047","doi-asserted-by":"crossref","DOI":"10.1142\/S0218126622500414","article-title":"Correlation filters based on strong spatio-temporal for robust RGB-T tracking","volume":"31","author":"Luo","year":"2022","journal-title":"Journal of Circuits, Systems and Computers"},{"issue":"9","key":"10.1016\/j.eswa.2026.132426_bib0048","doi-asserted-by":"crossref","first-page":"15517","DOI":"10.1109\/JSEN.2024.3370144","article-title":"Learning multifrequency integration network for RGBT tracking","volume":"24","author":"Mei","year":"2024","journal-title":"IEEE Sensors Journal"},{"issue":"12","key":"10.1016\/j.eswa.2026.132426_bib0049","doi-asserted-by":"crossref","first-page":"11908","DOI":"10.1109\/TCSVT.2025.3587703","article-title":"BR-MOE: Blind multi-modal tracking with route-dynamic mixture of experts","volume":"35","author":"Meng","year":"2025","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"10.1016\/j.eswa.2026.132426_bib0050","series-title":"Proceedings of the computer vision and pattern recognition conference","first-page":"17990","article-title":"Image quality assessment: Investigating causal perceptual effects with abductive counterfactual inference","author":"Shen","year":"2025"},{"key":"10.1016\/j.eswa.2026.132426_bib0051","first-page":"1","article-title":"Boundary-aware feature fusion with dual-stream attention for remote sensing small object detection","volume":"63","author":"Song","year":"2024","journal-title":"IEEE Transactions on Geoscience and Remote Sensing"},{"key":"10.1016\/j.eswa.2026.132426_bib0052","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"5734","article-title":"Xtrack: Multimodal training boosts RGB-X video object trackers","author":"Tan","year":"2025"},{"key":"10.1016\/j.eswa.2026.132426_bib0053","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2023.101881","article-title":"Exploring fusion strategies for accurate RGBT visual object tracking","volume":"99","author":"Tang","year":"2023","journal-title":"Information Fusion"},{"key":"10.1016\/j.eswa.2026.132426_bib0054","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"5189","article-title":"Generative-based fusion mechanism for multi-modal tracking","volume":"vol. 38","author":"Tang","year":"2024"},{"key":"10.1016\/j.eswa.2026.132426_bib0055","doi-asserted-by":"crossref","first-page":"7235","DOI":"10.1109\/TIP.2025.3611687","article-title":"Revisiting RGBT tracking benchmarks from the perspective of modality validity: A new benchmark, problem, and solution","volume":"34","author":"Tang","year":"2025","journal-title":"IEEE Transactions on Image Processing"},{"key":"10.1016\/j.eswa.2026.132426_bib0056","doi-asserted-by":"crossref","first-page":"167","DOI":"10.1109\/TICPS.2023.3307340","article-title":"SiamTDR: Time-efficient RGBT tracking via disentangled representations","volume":"1","author":"Wang","year":"2023","journal-title":"IEEE Transactions on Industrial Cyber-Physical Systems"},{"key":"10.1016\/j.eswa.2026.132426_bib0057","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"5436","article-title":"Temporal adaptive RGBT tracking with modality prompt","volume":"vol. 38","author":"Wang","year":"2024"},{"key":"10.1016\/j.eswa.2026.132426_bib0058","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.102940","article-title":"Multi-modal adapter for RGB-T tracking","volume":"118","author":"Wang","year":"2025","journal-title":"Information Fusion"},{"issue":"12","key":"10.1016\/j.eswa.2026.132426_bib0059","doi-asserted-by":"crossref","first-page":"12770","DOI":"10.1109\/TCSVT.2024.3436878","article-title":"Visual and language collaborative learning for RGBT object tracking","volume":"34","author":"Wang","year":"2024","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"10.1016\/j.eswa.2026.132426_bib0060","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2023.119865","article-title":"RGBT tracking using randomly projected CNN features","volume":"223","author":"Wang","year":"2023","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.eswa.2026.132426_bib0061","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"19156","article-title":"Single-model and any-modality for video object tracking","author":"Wu","year":"2024"},{"key":"10.1016\/j.eswa.2026.132426_bib0062","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"2831","article-title":"Attribute-based progressive fusion network for RGBT tracking","volume":"vol. 36","author":"Xiao","year":"2022"},{"issue":"1","key":"10.1016\/j.eswa.2026.132426_bib0063","doi-asserted-by":"crossref","first-page":"959","DOI":"10.1109\/TCSVT.2025.3595632","article-title":"Feature fusion and enhancement for lightweight visible-thermal infrared tracking via multiple adapters","volume":"36","author":"Xue","year":"2025","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"10.1016\/j.eswa.2026.132426_bib0064","article-title":"Tiptrack: Time-series information prompt network for RGBT tracking","volume":"296","author":"Yan","year":"2025","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.eswa.2026.132426_bib0065","series-title":"2023 IEEE international conference on mechatronics and automation (ICMA)","first-page":"351","article-title":"Differential enhancement and commonality fusion for RGBT tracking","author":"Yang","year":"2023"},{"issue":"6","key":"10.1016\/j.eswa.2026.132426_bib0066","doi-asserted-by":"crossref","first-page":"1934","DOI":"10.1007\/s12559-023-10158-z","article-title":"Deep triply attention network for RGBT tracking","volume":"15","author":"Yang","year":"2023","journal-title":"Cognitive Computation"},{"key":"10.1016\/j.eswa.2026.132426_bib0067","series-title":"European conference on computer vision","first-page":"509","article-title":"Translation, scale and rotation: Cross-modal alignment meets RGB-infrared vehicle detection","author":"Yuan","year":"2022"},{"key":"10.1016\/j.eswa.2026.132426_bib0068","unstructured":"Zeng, Z., Liu, X., Sun, M., Wang, H., & Liu, J. (2024). Cross fusion RGB-T tracking with bi-directional adapter. arXiv preprint arXiv: 2408.16979."},{"issue":"10","key":"10.1016\/j.eswa.2026.132426_bib0069","doi-asserted-by":"crossref","first-page":"29311","DOI":"10.1007\/s11042-023-16418-2","article-title":"RGBT tracking based on modality feature enhancement","volume":"83","author":"Zhai","year":"2024","journal-title":"Multimedia Tools and Applications"},{"key":"10.1016\/j.eswa.2026.132426_bib0070","doi-asserted-by":"crossref","DOI":"10.1016\/j.optlaseng.2025.109201","article-title":"SFNet: A dual-enhanced RGBT tracker via global-local modality refinement and frequency-spatial cross-modal fusion","volume":"194","author":"Zhang","year":"2025","journal-title":"Optics and Lasers in Engineering"},{"issue":"2","key":"10.1016\/j.eswa.2026.132426_bib0071","doi-asserted-by":"crossref","first-page":"393","DOI":"10.3390\/s20020393","article-title":"Object tracking in RGB-T videos using modal-aware attention network and competitive learning","volume":"20","author":"Zhang","year":"2020","journal-title":"Sensors"},{"issue":"2","key":"10.1016\/j.eswa.2026.132426_bib0072","doi-asserted-by":"crossref","first-page":"1900","DOI":"10.1109\/TITS.2024.3512551","article-title":"SiamTFA: Siamese triple-stream feature aggregation network for efficient RGBT tracking","volume":"26","author":"Zhang","year":"2024","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"key":"10.1016\/j.eswa.2026.132426_bib0073","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision workshops","article-title":"Multi-modal fusion for end-to-end RGB-T tracking","author":"Zhang","year":"2019"},{"key":"10.1016\/j.eswa.2026.132426_bib0074","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110984","article-title":"UniRTL: A universal RGBT and low-light benchmark for object tracking","volume":"158","author":"Zhang","year":"2025","journal-title":"Pattern Recognition"},{"key":"10.1016\/j.eswa.2026.132426_bib0075","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"5127","article-title":"Weakly aligned cross-modal learning for multispectral pedestrian detection","author":"Zhang","year":"2019"},{"issue":"9","key":"10.1016\/j.eswa.2026.132426_bib0076","doi-asserted-by":"crossref","first-page":"2714","DOI":"10.1007\/s11263-021-01495-3","article-title":"Learning adaptive attribute-driven representation for real-time RGB-T tracking","volume":"129","author":"Zhang","year":"2021","journal-title":"International Journal of Computer Vision"},{"key":"10.1016\/j.eswa.2026.132426_bib0077","doi-asserted-by":"crossref","first-page":"3335","DOI":"10.1109\/TIP.2021.3060862","article-title":"Jointly modeling motion and appearance cues for robust RGB-T tracking","volume":"30","author":"Zhang","year":"2021","journal-title":"IEEE Transactions on Image Processing"},{"key":"10.1016\/j.eswa.2026.132426_bib0078","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"8886","article-title":"Visible-thermal UAV tracking: A large-scale benchmark and new baseline","author":"Zhang","year":"2022"},{"key":"10.1016\/j.eswa.2026.132426_bib0079","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"5404","article-title":"Efficient RGB-T tracking via cross-modality distillation","author":"Zhang","year":"2023"},{"issue":"8","key":"10.1016\/j.eswa.2026.132426_bib0080","doi-asserted-by":"crossref","first-page":"7386","DOI":"10.1109\/TCSVT.2024.3377471","article-title":"AMNet: Learning to align multi-modality for RGB-T tracking","volume":"34","author":"Zhang","year":"2024","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"issue":"7","key":"10.1016\/j.eswa.2026.132426_bib0081","doi-asserted-by":"crossref","first-page":"5847","DOI":"10.1109\/TPAMI.2025.3555485","article-title":"Cross-modality distillation for multi-modal tracking","volume":"47","author":"Zhang","year":"2025","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"11","key":"10.1016\/j.eswa.2026.132426_bib0082","doi-asserted-by":"crossref","first-page":"8282","DOI":"10.1109\/TII.2025.3588622","article-title":"GAANet: Graph aggregation alignment feature fusion for multispectral object detection","volume":"21","author":"Zheng","year":"2025","journal-title":"IEEE Transactions on Industrial Informatics"},{"issue":"2","key":"10.1016\/j.eswa.2026.132426_bib0083","doi-asserted-by":"crossref","first-page":"5752","DOI":"10.1109\/TCE.2025.3570181","article-title":"AFES: Attention-based feature excitation and sorting for action recognition","volume":"71","author":"Zhou","year":"2025","journal-title":"IEEE Transactions on Consumer Electronics"},{"key":"10.1016\/j.eswa.2026.132426_bib0084","doi-asserted-by":"crossref","first-page":"7444","DOI":"10.1109\/TMM.2025.3599097","article-title":"COFNet: Contrastive object-aware fusion using box-level masks for multispectral object detection","volume":"27","author":"Zhou","year":"2025","journal-title":"IEEE Transactions on Multimedia"},{"issue":"6","key":"10.1016\/j.eswa.2026.132426_bib0085","doi-asserted-by":"crossref","first-page":"3242","DOI":"10.1007\/s11263-024-02338-7","article-title":"Blind image quality assessment: Exploring content fidelity perceptibility via quality adversarial learning","volume":"133","author":"Zhou","year":"2025","journal-title":"International Journal of Computer Vision"},{"issue":"4","key":"10.1016\/j.eswa.2026.132426_bib0086","first-page":"1","article-title":"Robust RGB-T tracking via adaptive modality weight correlation filters and cross-modality learning","volume":"20","author":"Zhou","year":"2023","journal-title":"ACM Transactions on Multimedia Computing, Communications and Applications"},{"key":"10.1016\/j.eswa.2026.132426_bib0087","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"9516","article-title":"Visual prompt multi-modal tracking","author":"Zhu","year":"2023"}],"container-title":["Expert Systems with Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426013394?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426013394?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,17]],"date-time":"2026-06-17T23:27:30Z","timestamp":1781738850000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0957417426013394"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8]]},"references-count":87,"alternative-id":["S0957417426013394"],"URL":"https:\/\/doi.org\/10.1016\/j.eswa.2026.132426","relation":{},"ISSN":["0957-4174"],"issn-type":[{"value":"0957-4174","type":"print"}],"subject":[],"published":{"date-parts":[[2026,8]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"HATrack: Cross-modal fusion RGBT tracking with heterogeneous adapter","name":"articletitle","label":"Article Title"},{"value":"Expert Systems with Applications","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.eswa.2026.132426","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"132426"}}