{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,13]],"date-time":"2026-07-13T22:09:54Z","timestamp":1783980594815,"version":"3.55.0"},"reference-count":95,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,1,1]],"date-time":"2023-01-01T00:00:00Z","timestamp":1672531200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["42071297"],"award-info":[{"award-number":["42071297"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["41871235"],"award-info":[{"award-number":["41871235"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Geosci. Remote Sensing"],"published-print":{"date-parts":[[2023]]},"DOI":"10.1109\/tgrs.2023.3268232","type":"journal-article","created":{"date-parts":[[2023,4,19]],"date-time":"2023-04-19T17:28:46Z","timestamp":1681925326000},"page":"1-17","source":"Crossref","is-referenced-by-count":107,"title":["CMID: A Unified Self-Supervised Learning Framework for Remote Sensing Image Understanding"],"prefix":"10.1109","volume":"61","author":[{"given":"Dilxat","family":"Muhtar","sequence":"first","affiliation":[{"name":"Jiangsu Provincial Key Laboratory of Geographic Information Science and Technology, Key Laboratory for Land Satellite Remote Sensing Applications of Ministry of Natural Resources, School of Geography and Ocean Science, Nanjing University, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6188-0257","authenticated-orcid":false,"given":"Xueliang","family":"Zhang","sequence":"additional","affiliation":[{"name":"Jiangsu Provincial Key Laboratory of Geographic Information Science and Technology, Key Laboratory for Land Satellite Remote Sensing Applications of Ministry of Natural Resources, School of Geography and Ocean Science, Nanjing University, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2739-3302","authenticated-orcid":false,"given":"Pengfeng","family":"Xiao","sequence":"additional","affiliation":[{"name":"Jiangsu Provincial Key Laboratory of Geographic Information Science and Technology, Key Laboratory for Land Satellite Remote Sensing Applications of Ministry of Natural Resources, School of Geography and Ocean Science, Nanjing University, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0552-2230","authenticated-orcid":false,"given":"Zhenshi","family":"Li","sequence":"additional","affiliation":[{"name":"Jiangsu Provincial Key Laboratory of Geographic Information Science and Technology, Key Laboratory for Land Satellite Remote Sensing Applications of Ministry of Natural Resources, School of Geography and Ocean Science, Nanjing University, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Feng","family":"Gu","sequence":"additional","affiliation":[{"name":"Jiangsu Provincial Key Laboratory of Geographic Information Science and Technology, Key Laboratory for Land Satellite Remote Sensing Applications of Ministry of Natural Resources, School of Geography and Ocean Science, Nanjing University, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref13","first-page":"21271","article-title":"Bootstrap your own latent&#x2014;A new approach to self-supervised learning","volume":"33","author":"grill","year":"2020","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref57","first-page":"1691","article-title":"Generative pretraining from pixels","author":"chen","year":"2020","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00674"},{"key":"ref56","first-page":"16238","article-title":"Revisiting contrastive methods for unsupervised learning of visual representations","volume":"34","author":"van gansbeke","year":"2021","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00928"},{"key":"ref59","first-page":"8821","article-title":"Zero-shot text-to-image generation","author":"ramesh","year":"2021","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2022.3194732"},{"key":"ref58","article-title":"BEiT: BERT pre-training of image transformers","author":"bao","year":"2021","journal-title":"arXiv 2106 08254"},{"key":"ref53","article-title":"Self-EMD: Self-supervised object detection without ImageNet","author":"liu","year":"2020","journal-title":"arXiv 2011 13677"},{"key":"ref52","first-page":"4489","article-title":"Unsupervised learning of dense visual representations","volume":"33","author":"pinheiro","year":"2020","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref11","article-title":"Improved baselines with momentum contrastive learning","author":"chen","year":"2020","journal-title":"arXiv 2003 04297"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01037"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.2992393"},{"key":"ref54","article-title":"RegionCL: Can simple region swapping contribute to contrastive learning?","author":"xu","year":"2021","journal-title":"arXiv 2111 12309"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.3390\/technologies9010002"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01002"},{"key":"ref19","article-title":"Representation learning for remote sensing: An unsupervised sensor fusion approach","author":"swope","year":"2021","journal-title":"arXiv 2108 05094"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2020.3007029"},{"key":"ref93","article-title":"Partial convolution based padding","author":"liu","year":"2018","journal-title":"arXiv 1811 11718"},{"key":"ref92","first-page":"806","article-title":"Sparse convolutional neural networks","author":"liu","year":"2015","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01641"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19821-2_26"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00304"},{"key":"ref94","first-page":"1","article-title":"Stochastic neighbor embedding","volume":"15","author":"hinton","year":"2002","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19821-2_28"},{"key":"ref90","year":"2021","journal-title":"MMSelfSup Openmmlab Self-Supervised Learning Toolbox and Benchmark"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01549"},{"key":"ref45","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","author":"chen","year":"2020","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2021.3095166"},{"key":"ref48","first-page":"9912","article-title":"Unsupervised learning of visual features by contrasting cluster assignments","volume":"33","author":"caron","year":"2020","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref47","first-page":"12310","article-title":"Barlow Twins: Self-supervised learning via redundancy reduction","author":"zbontar","year":"2021","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW53098.2021.00129"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00350"},{"key":"ref41","article-title":"Masked Siamese ConvNets","author":"jing","year":"2022","journal-title":"arXiv 2206 07700"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3548541"},{"key":"ref44","article-title":"Representation learning with contrastive predictive coding","author":"van den oord","year":"2018","journal-title":"arXiv 1807 03748"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2018.2858817"},{"key":"ref43","first-page":"857","article-title":"Self-supervised learning: Generative or contrastive","volume":"35","author":"liu","year":"2023","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.5194\/isprs-archives-XLII-2-565-2018"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00950"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1117\/1.JRS.11.042609"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1016\/j.rse.2020.111716"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/MGRS.2022.3198244"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1016\/j.isprsjprs.2019.11.023"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1016\/j.isprsjprs.2016.03.014"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1016\/j.isprsjprs.2019.04.015"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/MGRS.2017.2762307"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.308"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00612"},{"key":"ref40","article-title":"What should not be contrastive in contrastive learning","author":"xiao","year":"2020","journal-title":"arXiv 2008 05659"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00418"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.7000"},{"key":"ref80","article-title":"mixup: Beyond empirical risk minimization","author":"zhang","year":"2017","journal-title":"arXiv 1710 09412"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3073319"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW50498.2020.00359"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2017.2675998"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1145\/1869790.1869829"},{"key":"ref37","article-title":"MixMAE: Mixed and masked autoencoder for efficient pretraining of hierarchical vision transformers","author":"liu","year":"2022","journal-title":"arXiv 2205 13137"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2022.3177770"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3548173"},{"key":"ref75","article-title":"Adan: Adaptive Nesterov momentum algorithm for faster optimizing deep models","author":"xie","year":"2022","journal-title":"arXiv 2208 06677"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00943"},{"key":"ref74","year":"2020","journal-title":"MMSegmentation Openmmlab semantic segmentation toolbox and benchmark"},{"key":"ref33","article-title":"Siamese image modeling for self-supervised vision representation learning","author":"tao","year":"2022","journal-title":"arXiv 2206 01204"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/JSTARS.2021.3070368"},{"key":"ref32","article-title":"Contrastive masked autoencoders are stronger vision learners","author":"huang","year":"2022","journal-title":"arXiv 2207 13532"},{"key":"ref76","first-page":"418","article-title":"Unified perceptual parsing for scene understanding","author":"xiao","year":"2018","journal-title":"Proc Eur Conf Comput Vis (ECCV)"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.3390\/s19051058"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/s11119-021-09806-x"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00381"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01366"},{"key":"ref70","article-title":"Architecture-agnostic masked image modeling&#x2014;From ViT back to CNN","author":"li","year":"2022","journal-title":"arXiv 2205 13943"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW56347.2022.00148"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2021.3109957"},{"key":"ref23","article-title":"SatMAE: Pre-training transformers for temporal and multi-spectral satellite imagery","author":"cong","year":"2022","journal-title":"arXiv 2207 08051"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/LGRS.2021.3069799"},{"key":"ref26","article-title":"An image is worth 16&#x00D7;16 words: Transformers for image recognition at scale","author":"dosovitskiy","year":"2020","journal-title":"arXiv 2010 11929"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2022.3222818"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2022.3147513"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2021.3115569"},{"key":"ref64","article-title":"Benchmarking detection transfer learning with vision transformers","author":"li","year":"2021","journal-title":"arXiv 2111 11429"},{"key":"ref63","article-title":"Contrastive learning rivals masked image modeling in fine-tuning via feature distillation","author":"wei","year":"2022","journal-title":"arXiv 2205 14141"},{"key":"ref22","article-title":"SITS-former: A pre-trained spatio-spectral-temporal representation model for Sentinel-2 time series classification","volume":"106","author":"yuan","year":"2022","journal-title":"Int J Appl Earth Observ Geoinf"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58621-8_45"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2021.3128072"},{"key":"ref65","article-title":"Designing BERT for convolutional networks: Sparse and hierarchical masked modeling","author":"tian","year":"2023","journal-title":"arXiv 2301 03580"},{"key":"ref28","article-title":"Transformers in remote sensing: A survey","author":"aleissaee","year":"2022","journal-title":"arXiv 2209 01206"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2022.3176603"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"ref60","article-title":"PeCo: Perceptual codebook for BERT pre-training of vision transformers","author":"dong","year":"2021","journal-title":"arXiv 2111 12710"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01426"},{"key":"ref61","article-title":"iBOT: Image BERT pre-training with online tokenizer","author":"zhou","year":"2021","journal-title":"arXiv 2111 07832"}],"container-title":["IEEE Transactions on Geoscience and Remote Sensing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/36\/10006360\/10105625.pdf?arnumber=10105625","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,5,29]],"date-time":"2023-05-29T17:37:43Z","timestamp":1685381863000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10105625\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023]]},"references-count":95,"URL":"https:\/\/doi.org\/10.1109\/tgrs.2023.3268232","relation":{},"ISSN":["0196-2892","1558-0644"],"issn-type":[{"value":"0196-2892","type":"print"},{"value":"1558-0644","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023]]}}}