{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,13]],"date-time":"2026-07-13T19:50:52Z","timestamp":1783972252862,"version":"3.55.0"},"reference-count":62,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100003453","name":"Natural Science Foundation of Guangdong Province","doi-asserted-by":"publisher","award":["2025A1515010245"],"award-info":[{"award-number":["2025A1515010245"]}],"id":[{"id":"10.13039\/501100003453","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"NSFC","doi-asserted-by":"publisher","award":["62476102"],"award-info":[{"award-number":["62476102"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Knowledge-Based Systems"],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1016\/j.knosys.2026.115721","type":"journal-article","created":{"date-parts":[[2026,3,9]],"date-time":"2026-03-09T09:40:02Z","timestamp":1773049202000},"page":"115721","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":3,"special_numbering":"C","title":["Vision transformer for contrastive clustering"],"prefix":"10.1016","volume":"340","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-2191-4033","authenticated-orcid":false,"given":"Hua-Bao","family":"Ling","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bowen","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3923-8828","authenticated-orcid":false,"given":"Dong","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ding-Hua","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chang-Dong","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jian-Huang","family":"Lai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.knosys.2026.115721_bib0001","series-title":"Proc. of International Conference on Learning Representations (ICLR)","article-title":"An image is worth 16x16 words: transformers for image recognition at scale","author":"Dosovitskiy","year":"2021"},{"key":"10.1016\/j.knosys.2026.115721_bib0002","series-title":"Proc. of IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","article-title":"Deep residual learning for image recognition","author":"He","year":"2016"},{"key":"10.1016\/j.knosys.2026.115721_bib0003","series-title":"Advanced in Neural Information Processing Systems (NeurIPS)","article-title":"Attention is all you need","author":"Vaswani","year":"2017"},{"key":"10.1016\/j.knosys.2026.115721_bib0004","series-title":"Proc. of European Conference on Computer Vision (ECCV)","article-title":"End-to-end object detection with transformers","author":"Carion","year":"2020"},{"key":"10.1016\/j.knosys.2026.115721_bib0005","series-title":"Proc. of IEEE International Conference on Computer Vision (ICCV)","article-title":"Segmenter: transformer for semantic segmentation","author":"Strudel","year":"2021"},{"key":"10.1016\/j.knosys.2026.115721_bib0006","series-title":"Proc. of International Conference on Machine Learning (ICML)","article-title":"A simple framework for contrastive learning of visual representations","author":"Chen","year":"2020"},{"key":"10.1016\/j.knosys.2026.115721_bib0007","series-title":"Proc. of IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","article-title":"Momentum contrast for unsupervised visual representation learning","author":"He","year":"2020"},{"key":"10.1016\/j.knosys.2026.115721_bib0008","doi-asserted-by":"crossref","DOI":"10.1109\/TKDE.2021.3090866","article-title":"Self-supervised learning: generative or contrastive","author":"Liu","year":"2021","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"10.1016\/j.knosys.2026.115721_bib0009","series-title":"Advanced in Neural Information Processing Systems (NeurIPS)","article-title":"Conditional image generation with PixelCNN decoders","author":"Van den Oord","year":"2016"},{"key":"10.1016\/j.knosys.2026.115721_bib0010","unstructured":"A. Radford, L. Metz, S. Chintala, Unsupervised representation learning with deep convolutional generative adversarial networks, arXiv: 1511.06434(2015)."},{"key":"10.1016\/j.knosys.2026.115721_bib0011","unstructured":"O.A. van den, Y. Li, O. Vinyals, Representation learning with contrastive predictive coding, arXiv: 1807.03748(2018)."},{"key":"10.1016\/j.knosys.2026.115721_bib0012","series-title":"Proc. of IEEE International Conference on Computer Vision (ICCV)","article-title":"An empirical study of training self-supervised vision transformers","author":"Chen","year":"2021"},{"key":"10.1016\/j.knosys.2026.115721_bib0013","series-title":"Proc. of IEEE International Conference on Computer Vision (ICCV)","article-title":"Emerging properties in self-supervised vision transformers","author":"Caron","year":"2021"},{"key":"10.1016\/j.knosys.2026.115721_bib0014","series-title":"Proc. of AAAI Conference on Artificial Intelligence (AAAI)","article-title":"Contrastive clustering","author":"Li","year":"2021"},{"key":"10.1016\/j.knosys.2026.115721_bib0015","series-title":"Advanced in Neural Information Processing Systems (NeurIPS)","article-title":"Early convolutions help transformers see better","author":"Xiao","year":"2021"},{"key":"10.1016\/j.knosys.2026.115721_bib0016","series-title":"Proc. of International Conference on Machine Learning (ICML)","article-title":"EfficientNet: rethinking model scaling for convolutional neural networks","author":"Tan","year":"2019"},{"key":"10.1016\/j.knosys.2026.115721_bib0017","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"4700","article-title":"Densely connected convolutional networks","author":"Huang","year":"2017"},{"key":"10.1016\/j.knosys.2026.115721_bib0018","series-title":"Proc. of IEEE International Conference on Computer Vision (ICCV)","article-title":"Swin transformer: hierarchical vision transformer using shifted windows","author":"Liu","year":"2021"},{"key":"10.1016\/j.knosys.2026.115721_bib0019","unstructured":"X. Zhu, W. Su, L. Lu, B. Li, X. Wang, J. Dai, Deformable DETR: Deformable transformers for end-to-end object detection, arXiv: 2010.04159(2020)."},{"key":"10.1016\/j.knosys.2026.115721_bib0020","series-title":"Proc. of IEEE International Conference on Computer Vision (ICCV)","article-title":"CVT: introducing convolutions to vision transformers","author":"Wu","year":"2021"},{"key":"10.1016\/j.knosys.2026.115721_bib0021","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"12175","article-title":"CMT: convolutional neural networks meet vision transformers","author":"Guo","year":"2022"},{"issue":"6","key":"10.1016\/j.knosys.2026.115721_bib0022","doi-asserted-by":"crossref","first-page":"1212","DOI":"10.1109\/TKDE.2019.2903410","article-title":"Ultra-scalable spectral clustering and ensemble clustering","volume":"32","author":"Huang","year":"2020","journal-title":"IEEE Trans. Knowl. Data Eng."},{"issue":"11","key":"10.1016\/j.knosys.2026.115721_bib0023","doi-asserted-by":"crossref","first-page":"11388","DOI":"10.1109\/TKDE.2023.3236698","article-title":"Fast multi-view clustering via ensembles: towards scalability, superiority, and simplicity","volume":"35","author":"Huang","year":"2023","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"10.1016\/j.knosys.2026.115721_bib0024","doi-asserted-by":"crossref","first-page":"364","DOI":"10.1016\/j.inffus.2022.10.020","article-title":"Seeking commonness and inconsistencies: a jointly smoothed approach to multi-view subspace clustering","volume":"91","author":"Cai","year":"2023","journal-title":"Inf. Fusion"},{"issue":"8","key":"10.1016\/j.knosys.2026.115721_bib0025","doi-asserted-by":"crossref","first-page":"11436","DOI":"10.1109\/TNNLS.2023.3261460","article-title":"Efficient multi-view clustering via unified and discrete bipartite graph learning","volume":"35","author":"Fang","year":"2024","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"issue":"2","key":"10.1016\/j.knosys.2026.115721_bib0026","doi-asserted-by":"crossref","first-page":"2848","DOI":"10.1109\/TNNLS.2022.3192445","article-title":"Multi-view graph learning by joint modeling of consistency and inconsistency","volume":"35","author":"Liang","year":"2024","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.knosys.2026.115721_bib0027","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.108003","article-title":"One-step bipartite graph cut: a normalized formulation and its application to scalable subspace clustering","volume":"193","author":"Fang","year":"2026","journal-title":"Neural Netw."},{"key":"10.1016\/j.knosys.2026.115721_bib0028","series-title":"Proc. of Mathematical Statistics and Probability","article-title":"Some methods for classification and analysis of multivariate observations","author":"MacQueen","year":"1967"},{"key":"10.1016\/j.knosys.2026.115721_bib0029","series-title":"Advanced in Neural Information Processing Systems (NeurIPS)","article-title":"Self-tuning spectral clustering","author":"Zelnik-Manor","year":"2005"},{"issue":"2","key":"10.1016\/j.knosys.2026.115721_bib0030","doi-asserted-by":"crossref","first-page":"105","DOI":"10.1016\/0031-3203(78)90018-3","article-title":"Agglomerative clustering using the concept of mutual nearest neighbourhood","volume":"10","author":"Gowda","year":"1978","journal-title":"Pattern Recognit."},{"issue":"2","key":"10.1016\/j.knosys.2026.115721_bib0031","doi-asserted-by":"crossref","first-page":"263","DOI":"10.1007\/s00357-003-0015-3","article-title":"Enhanced model-based clustering, density estimation, and discriminant analysis software: MCLUST","volume":"20","author":"Fraley","year":"2003","journal-title":"J. Classif."},{"key":"10.1016\/j.knosys.2026.115721_bib0032","series-title":"Proc. of International Joint Conference on Artificial Intelligence (IJCAI)","article-title":"Improved deep embedded clustering with local structure preservation","author":"Guo","year":"2017"},{"key":"10.1016\/j.knosys.2026.115721_bib0033","series-title":"Proc. of International Conference on Machine Learning (ICML)","article-title":"Unsupervised deep embedding for clustering analysis","author":"Xie","year":"2016"},{"key":"10.1016\/j.knosys.2026.115721_bib0034","article-title":"Deep clustering and visualization for end-to-end high-dimensional data analysis","author":"Wu","year":"2022","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.knosys.2026.115721_bib0035","series-title":"Kdd","first-page":"226","article-title":"A density-based algorithm for discovering clusters in large spatial databases with noise","volume":"96","author":"Ester","year":"1996"},{"key":"10.1016\/j.knosys.2026.115721_bib0036","first-page":"2148","article-title":"Multi-view contrastive graph clustering","volume":"34","author":"Pan","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115721_bib0037","doi-asserted-by":"crossref","first-page":"256","DOI":"10.1016\/j.ins.2022.09.042","article-title":"Multilayer graph contrastive clustering network","volume":"613","author":"Liu","year":"2022","journal-title":"Inf. Sci."},{"key":"10.1016\/j.knosys.2026.115721_bib0038","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2023.109470","article-title":"Strongly augmented contrastive clustering","volume":"139","author":"Deng","year":"2023","journal-title":"Pattern Recognit."},{"issue":"10","key":"10.1016\/j.knosys.2026.115721_bib0039","doi-asserted-by":"crossref","first-page":"9472","DOI":"10.1109\/TCSVT.2024.3399596","article-title":"Deep clustering with hybrid-grained contrastive and discriminative learning","volume":"34","author":"Huang","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.knosys.2026.115721_bib0040","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107217","article-title":"Pyramid contrastive learning for clustering","volume":"185","author":"Zhou","year":"2025","journal-title":"Neural Netw."},{"key":"10.1016\/j.knosys.2026.115721_bib0041","series-title":"Proc. of International Conference on Machine Learning (ICML)","article-title":"Training data-efficient image transformers & distillation through attention","author":"Touvron","year":"2021"},{"issue":"5","key":"10.1016\/j.knosys.2026.115721_bib0042","doi-asserted-by":"crossref","first-page":"2486","DOI":"10.1109\/TGRS.2016.2645610","article-title":"Accurate object localization in remote sensing images based on convolutional neural networks","volume":"55","author":"Long","year":"2017","journal-title":"IEEE Trans. Geosci. Remote Sens."},{"key":"10.1016\/j.knosys.2026.115721_bib0043","series-title":"Proc. of SIGSPATIAL International Conference on Advances in Geographic Information Systems","article-title":"Bag-of-visual-words and spatial extensions for land-use classification","author":"Yang","year":"2010"},{"issue":"4","key":"10.1016\/j.knosys.2026.115721_bib0044","doi-asserted-by":"crossref","first-page":"2108","DOI":"10.1109\/TGRS.2015.2496185","article-title":"Dirichlet-derived multiple topic scene classification model for high spatial resolution remote sensing imagery","volume":"54","author":"Zhao","year":"2015","journal-title":"IEEE Trans. Geosci. Remote Sens."},{"issue":"7","key":"10.1016\/j.knosys.2026.115721_bib0045","doi-asserted-by":"crossref","first-page":"3965","DOI":"10.1109\/TGRS.2017.2685945","article-title":"AID: a benchmark data set for performance evaluation of aerial scene classification","volume":"55","author":"Xia","year":"2017","journal-title":"IEEE Trans. Geosci. Remote Sens."},{"key":"10.1016\/j.knosys.2026.115721_bib0046","doi-asserted-by":"crossref","first-page":"233","DOI":"10.1016\/j.compag.2018.07.014","article-title":"Multi-level learning features for automatic classification of field crop pests","volume":"152","author":"Xie","year":"2018","journal-title":"Comput. Electron. Agric."},{"key":"10.1016\/j.knosys.2026.115721_bib0047","series-title":"Proc. of IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","article-title":"Describing textures in the wild","author":"Cimpoi","year":"2014"},{"issue":"4","key":"10.1016\/j.knosys.2026.115721_bib0048","doi-asserted-by":"crossref","first-page":"881","DOI":"10.1109\/TMI.2021.3125459","article-title":"Hard sample aware noise robust learning for histopathology image classification","volume":"41","author":"Zhu","year":"2021","journal-title":"IEEE Trans. Med. Imaging"},{"key":"10.1016\/j.knosys.2026.115721_bib0049","unstructured":"A. Krizhevsky, G. Hinton, et al., Learning multiple layers of features from tiny images (2009)."},{"key":"10.1016\/j.knosys.2026.115721_bib0050","series-title":"2009 IEEE Conference on Computer Vision and Pattern Recognition","first-page":"248","article-title":"ImageNet: a large-scale hierarchical image database","author":"Deng","year":"2009"},{"key":"10.1016\/j.knosys.2026.115721_bib0051","series-title":"Proceedings of the Fourteenth International Conference on Artificial Intelligence and Statistics","first-page":"215","article-title":"An analysis of single-layer networks in unsupervised feature learning","author":"Coates","year":"2011"},{"key":"10.1016\/j.knosys.2026.115721_bib0052","series-title":"Advanced in Neural Information Processing Systems (NeurIPS)","article-title":"Bootstrap your own latent-a new approach to self-supervised learning","author":"Grill","year":"2020"},{"issue":"12","key":"10.1016\/j.knosys.2026.115721_bib0053","first-page":"583","article-title":"Cluster ensembles\u2013a knowledge reuse framework for combining multiple partitions","volume":"3","author":"Strehl","year":"2002","journal-title":"J. Mach. Learn. Res."},{"issue":"6","key":"10.1016\/j.knosys.2026.115721_bib0054","doi-asserted-by":"crossref","first-page":"1212","DOI":"10.1109\/TKDE.2019.2903410","article-title":"Ultra-scalable spectral clustering and ensemble clustering","volume":"32","author":"Huang","year":"2020","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"10.1016\/j.knosys.2026.115721_bib0055","first-page":"1","article-title":"Toward multidiversified ensemble clustering of high-dimensional data: from subspaces to metrics and beyond","author":"Huang","year":"2021","journal-title":"IEEE Trans. Cybern."},{"key":"10.1016\/j.knosys.2026.115721_bib0056","series-title":"Proc. of International Joint Conference on Artificial Intelligence (IJCAI)","article-title":"Locality preserving nonnegative matrix factorization","author":"Cai","year":"2009"},{"issue":"2","key":"10.1016\/j.knosys.2026.115721_bib0057","doi-asserted-by":"crossref","first-page":"228","DOI":"10.1109\/34.908974","article-title":"PCA Versus LDA","volume":"23","author":"Martinez","year":"2001","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.knosys.2026.115721_bib0058","series-title":"Proc. of SIGMOD International Conference on Management of Data","article-title":"BIRCH: an efficient data clustering method for very large databases","author":"Zhang","year":"1996"},{"issue":"9","key":"10.1016\/j.knosys.2026.115721_bib0059","first-page":"1680","article-title":"Adaptive self-paced deep clustering with data augmentation","volume":"32","author":"Guo","year":"2019","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"10.1016\/j.knosys.2026.115721_bib0060","unstructured":"Y. Tao, K. Takagi, K. Nakata, Clustering-friendly representation learning via instance discrimination and feature decorrelation, arXiv: 2106.00131(2021)."},{"key":"10.1016\/j.knosys.2026.115721_bib0061","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"9706","article-title":"HCSC: hierarchical contrastive selective coding","author":"Guo","year":"2022"},{"issue":"11","key":"10.1016\/j.knosys.2026.115721_bib0062","article-title":"Visualizing data using t-SNE","volume":"9","author":"Van der Maaten","year":"2008","journal-title":"J. Mach. Learn. Res."}],"container-title":["Knowledge-Based Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126004612?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126004612?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,4,14]],"date-time":"2026-04-14T17:49:42Z","timestamp":1776188982000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0950705126004612"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5]]},"references-count":62,"alternative-id":["S0950705126004612"],"URL":"https:\/\/doi.org\/10.1016\/j.knosys.2026.115721","relation":{},"ISSN":["0950-7051"],"issn-type":[{"value":"0950-7051","type":"print"}],"subject":[],"published":{"date-parts":[[2026,5]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Vision transformer for contrastive clustering","name":"articletitle","label":"Article Title"},{"value":"Knowledge-Based Systems","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.knosys.2026.115721","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"115721"}}