{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,8]],"date-time":"2026-07-08T03:26:15Z","timestamp":1783481175810,"version":"3.55.0"},"reference-count":65,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"12","license":[{"start":{"date-parts":[[2023,12,1]],"date-time":"2023-12-01T00:00:00Z","timestamp":1701388800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,12,1]],"date-time":"2023-12-01T00:00:00Z","timestamp":1701388800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,12,1]],"date-time":"2023-12-01T00:00:00Z","timestamp":1701388800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"Key-Area Research and Development Program of Guangdong Province","award":["2020B090921003"],"award-info":[{"award-number":["2020B090921003"]}]},{"DOI":"10.13039\/501100019651","name":"Southern Marine Science and Engineering Guangdong Laboratory","doi-asserted-by":"publisher","award":["SML2020SP011"],"award-info":[{"award-number":["SML2020SP011"]}],"id":[{"id":"10.13039\/501100019651","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Circuits Syst. Video Technol."],"published-print":{"date-parts":[[2023,12]]},"DOI":"10.1109\/tcsvt.2023.3274545","type":"journal-article","created":{"date-parts":[[2023,5,11]],"date-time":"2023-05-11T00:05:40Z","timestamp":1683763540000},"page":"7466-7479","source":"Crossref","is-referenced-by-count":41,"title":["Mutually Beneficial Transformer for Multimodal Data Fusion"],"prefix":"10.1109","volume":"33","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4157-8605","authenticated-orcid":false,"given":"Jinping","family":"Wang","sequence":"first","affiliation":[{"name":"School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0137-9270","authenticated-orcid":false,"given":"Xiaojun","family":"Tan","sequence":"additional","affiliation":[{"name":"School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3218284"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2019.2952662"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3075745"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/tcsvt.2023.3245607"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1016\/j.sigpro.2020.107734"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2012.2208177"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/JSTARS.2015.2432037"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2017.2726901"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2020.2996599"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1080\/2150704X.2017.1335902"},{"key":"ref11","article-title":"CDDFuse: Correlation-driven dual-branch feature decomposition for multi-modality image fusion","author":"Zhao","year":"2022","journal-title":"arXiv:2211.14461"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2021.11.014"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00561"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3196679"},{"key":"ref15","article-title":"DDFM: Denoising diffusion model for multi-modality image fusion","author":"Zhao","year":"2023","journal-title":"arXiv:2303.06840"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2022.3162964"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3206807"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/tcsvt.2023.3239627"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2020\/135"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/LGRS.2017.2704625"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1016\/j.isprsjprs.2021.04.012"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.3390\/ijgi8010028"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.3390\/rs12122067"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.2976493"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2020.2969024"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW50498.2020.00054"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/tgrs.2020.2982064"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2022.3179737"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/tcsvt.2022.3148257"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-021-03819-2"},{"key":"ref31","first-page":"5998","article-title":"Attention is all you need","volume-title":"Proc. Adv. Neural Inf. Process. Syst. (NIPS)","author":"Vaswani"},{"key":"ref32","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018","journal-title":"arXiv:1810.04805"},{"key":"ref33","article-title":"An image is worth 16\u00d716 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020","journal-title":"arXiv:2010.11929"},{"key":"ref34","first-page":"10347","article-title":"Training data-efficient image transformers & distillation through attention","volume-title":"Proc. Int. Conf. Mach. Learn. (ICML)","author":"Touvron"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref36","first-page":"15908","article-title":"Transformer in transformer","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"34","author":"Han"},{"key":"ref37","article-title":"CSWin transformer: A general vision transformer backbone with cross-shaped windows","author":"Dong","year":"2021","journal-title":"arXiv:2107.00652"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00060"},{"key":"ref39","first-page":"9355","article-title":"Twins: Revisiting the design of spatial attention in vision transformers","volume-title":"Proc. Adv. Neural Inf. Process. Syst. (NIPS)","volume":"34","author":"Chu"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20053-3_28"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3152247"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00069"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00813"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01009"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58548-8_7"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1016\/j.jag.2022.102926"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.3390\/rs13030498"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2021.3130716"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2021.3115699"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2022.3144158"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00181"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/ICME51207.2021.9428272"},{"key":"ref53","article-title":"Multimodal learning with transformers: A survey","author":"Xu","year":"2022","journal-title":"arXiv:2206.06488"},{"key":"ref54","article-title":"Multimodal fusion transformer for remote sensing image classification","author":"Roy","year":"2022","journal-title":"arXiv:2203.16952"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.3390\/rs13183724"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1016\/0169-7439(87)80084-9"},{"key":"ref57","article-title":"Deformable DETR: Deformable transformers for end-to-end object detection","author":"Zhu","year":"2020","journal-title":"arXiv:2010.04159"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00797"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2021.12.008"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/JSTARS.2014.2305441"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2019.2907932"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/LGRS.2020.3017414"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1016\/j.isprsjprs.2021.05.011"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2021.3124913"},{"issue":"11","key":"ref65","first-page":"1","article-title":"Visualizing data using t-SNE","volume":"9","author":"Van der Maaten","year":"2008","journal-title":"J. Mach. Learn. Res."}],"container-title":["IEEE Transactions on Circuits and Systems for Video Technology"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/76\/10348119\/10122197.pdf?arnumber=10122197","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,12,20]],"date-time":"2023-12-20T01:24:33Z","timestamp":1703035473000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10122197\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,12]]},"references-count":65,"journal-issue":{"issue":"12"},"URL":"https:\/\/doi.org\/10.1109\/tcsvt.2023.3274545","relation":{},"ISSN":["1051-8215","1558-2205"],"issn-type":[{"value":"1051-8215","type":"print"},{"value":"1558-2205","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,12]]}}}