{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,21]],"date-time":"2026-03-21T19:26:03Z","timestamp":1774121163081,"version":"3.50.1"},"reference-count":95,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"5","license":[{"start":{"date-parts":[[2025,5,1]],"date-time":"2025-05-01T00:00:00Z","timestamp":1746057600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,5,1]],"date-time":"2025-05-01T00:00:00Z","timestamp":1746057600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,5,1]],"date-time":"2025-05-01T00:00:00Z","timestamp":1746057600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100017610","name":"Shenzhen Science and Technology Program","doi-asserted-by":"publisher","award":["RCYX20200714114736115"],"award-info":[{"award-number":["RCYX20200714114736115"]}],"id":[{"id":"10.13039\/501100017610","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Hong Kong Research Grants Council","award":["GRF-15229423"],"award-info":[{"award-number":["GRF-15229423"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Neural Netw. Learning Syst."],"published-print":{"date-parts":[[2025,5]]},"DOI":"10.1109\/tnnls.2024.3419898","type":"journal-article","created":{"date-parts":[[2024,7,9]],"date-time":"2024-07-09T14:43:13Z","timestamp":1720536193000},"page":"9550-9564","source":"Crossref","is-referenced-by-count":1,"title":["Teaching Masked Autoencoder With Strong Augmentations"],"prefix":"10.1109","volume":"36","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8892-247X","authenticated-orcid":false,"given":"Rui","family":"Zhu","sequence":"first","affiliation":[{"name":"School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8416-9027","authenticated-orcid":false,"given":"Yalong","family":"Bai","sequence":"additional","affiliation":[{"name":"Du Xiaoman, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7587-101X","authenticated-orcid":false,"given":"Ting","family":"Yao","sequence":"additional","affiliation":[{"name":"HiDream.ai, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3133-3644","authenticated-orcid":false,"given":"Jingen","family":"Liu","sequence":"additional","affiliation":[{"name":"Amazon, New York, NY, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8135-1659","authenticated-orcid":false,"given":"Zhenglong","family":"Sun","sequence":"additional","affiliation":[{"name":"School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2497-7732","authenticated-orcid":false,"given":"Tao","family":"Mei","sequence":"additional","affiliation":[{"name":"HiDream.ai, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6720-234X","authenticated-orcid":false,"given":"Chang","family":"Wen Chen","sequence":"additional","affiliation":[{"name":"Department of Computing, The Hong Kong Polytechnic University, Hong Kong, Hung Hom, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"ref3","article-title":"BEiT: BERT pre-training of image transformers","volume-title":"Proc. ICLR","author":"Bao"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"ref5","article-title":"What makes for good views for contrastive learning?","volume-title":"Proc. NeurIPS","author":"Tian"},{"key":"ref6","article-title":"A simple framework for contrastive learning of visual representations","volume-title":"Proc. ICML","author":"Chen"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01607"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01619"},{"key":"ref9","article-title":"Towards domain-agnostic contrastive learning","volume-title":"Proc. ICML","author":"Verma"},{"key":"ref10","article-title":"i-Mix: A domain-agnostic strategy for contrastive representation learning","volume-title":"Proc. ICLR","author":"Lee"},{"key":"ref11","article-title":"Masked Siamese ConvNets","author":"Jing","year":"2022","journal-title":"arXiv:2206.07700"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20056-4_7"},{"key":"ref13","article-title":"Context autoencoder for self-supervised representation learning","author":"Chen","year":"2022","journal-title":"arXiv:2202.03026"},{"key":"ref14","article-title":"A survey on masked autoencoder for self-supervised learning in vision and beyond","author":"Zhang","year":"2022","journal-title":"arXiv:2208.00173"},{"key":"ref15","article-title":"Self pre-training with masked autoencoders for medical image classification and segmentation","author":"Zhou","year":"2022","journal-title":"arXiv:2203.05573"},{"key":"ref16","article-title":"SatMAE: Pre-training transformers for temporal and multi-spectral satellite imagery","author":"Cong","year":"2022","journal-title":"arXiv:2207.08051"},{"key":"ref17","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. ICML","author":"Radford"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_9"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00305"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2021.3090866"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00537"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2021.3134634"},{"key":"ref23","article-title":"Generative pretraining from pixels","volume-title":"Proc. ICML","author":"Chen"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01014"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00950"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19821-2_26"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01549"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.5555\/3495724.3497510"},{"key":"ref29","article-title":"Unsupervised learning of visual features by contrasting cluster assignments","volume-title":"Proc. NeurIPS","author":"Caron"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00945"},{"key":"ref31","article-title":"BEiT V2: Masked image modeling with vector-quantized visual tokenizers","author":"Peng","year":"2022","journal-title":"arXiv:2208.06366"},{"key":"ref32","article-title":"Zero-shot text-to-image generation","volume-title":"Proc. ICML","author":"Ramesh"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20056-4_20"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i1.25130"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1145\/1390156.1390294"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20056-4_15"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00381"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00947"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1142\/S0218001493000339"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.465"},{"key":"ref41","article-title":"Energy-inspired self-supervised pretraining for vision models","volume-title":"Proc. ICLR","author":"Wang"},{"key":"ref42","article-title":"A tutorial on energy-based learning","volume-title":"Predicting Structured Data","author":"LeCun","year":"2006"},{"key":"ref43","article-title":"Implicit generation and generalization in energy-based models","volume-title":"Proc. NeurIPS","author":"Du"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00942"},{"key":"ref45","article-title":"Siamese image modeling for self-supervised vision representation learning","author":"Tao","year":"2022","journal-title":"arXiv:2206.01204"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00806"},{"key":"ref47","article-title":"Hybrid generative-contrastive representation learning","author":"Kim","year":"2021","journal-title":"arXiv:2106.06162"},{"key":"ref48","article-title":"iBOT: Image BERT pre-training with online tokenizer","volume-title":"Proc. ICLR","author":"Zhou"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01499"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00304"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01641"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00120"},{"key":"ref53","article-title":"Unsupervised learning of dense visual representations","volume-title":"Proc. NeurIPS","author":"Pinheiro"},{"key":"ref54","article-title":"Energy-based contrastive learning of visual representations","volume-title":"Proc. NeurIPS","author":"Kim"},{"key":"ref55","article-title":"Variational energy-based models: A probabilistic framework for contrastive self-supervised learning","volume-title":"Proc. NeurIPS Workshop","author":"Du"},{"key":"ref56","article-title":"Bayesian learning via stochastic gradient Langevin dynamics","volume-title":"Proc. ICML","author":"Welling"},{"key":"ref57","article-title":"GEDI: Generative and discriminative training for self-supervised learning","author":"Sansone","year":"2022","journal-title":"arXiv:2212.13425"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3329494"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3265607"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2022.3191086"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2022.3177775"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3068344"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3248871"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3314451"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2023.3263387"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01016"},{"key":"ref67","article-title":"An image is worth 16 \u00d7 16 words: Transformers for image recognition at scale","volume-title":"Proc. ICLR","author":"Dosovitskiy"},{"key":"ref68","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","volume-title":"Proc. NAACL","author":"Devlin"},{"key":"ref69","article-title":"Representation learning with contrastive predictive coding","author":"van den Oord","year":"2018","journal-title":"arXiv:1807.03748"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2006.100"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-018-1140-0"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01228-1_26"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1906.07155"},{"key":"ref75","article-title":"Decoupled weight decay regularization","volume-title":"Proc. ICLR","author":"Loshchilov"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01763"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1907.11692"},{"key":"ref79","article-title":"Electra: Pre-training text encoders as discriminators rather than generators","volume-title":"Proc. ICLR","author":"Clark"},{"key":"ref80","article-title":"SGDR: Stochastic gradient descent with warm restarts","volume-title":"Proc. ICLR","author":"Loshchilov"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW50498.2020.00359"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.308"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-387-30164-8_251"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00612"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20053-3_29"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00010"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1502.03167"},{"key":"ref88","article-title":"Layer normalization","author":"Lei Ba","year":"2016","journal-title":"arXiv:1607.06450"},{"key":"ref89","article-title":"A closer look at self-supervised lightweight vision transformers","author":"Wang","year":"2022","journal-title":"arXiv:2205.14443"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_14"},{"key":"ref91","article-title":"Training data-efficient image transformers & distillation through attention","volume-title":"Proc. ICML","author":"Touvron"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2013.77"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/ICVGIP.2008.47"},{"key":"ref94","article-title":"Exploring the role of mean teachers in self-supervised masked auto-encoders","author":"Lee","year":"2022","journal-title":"arXiv:2210.02077"},{"key":"ref95","article-title":"Prototypical contrastive learning of unsupervised representations","volume-title":"Proc. ICLR","author":"Li"}],"container-title":["IEEE Transactions on Neural Networks and Learning Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/5962385\/10982361\/10589697.pdf?arnumber=10589697","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,5]],"date-time":"2025-12-05T18:39:30Z","timestamp":1764959970000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10589697\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,5]]},"references-count":95,"journal-issue":{"issue":"5"},"URL":"https:\/\/doi.org\/10.1109\/tnnls.2024.3419898","relation":{},"ISSN":["2162-237X","2162-2388"],"issn-type":[{"value":"2162-237X","type":"print"},{"value":"2162-2388","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,5]]}}}