{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,9]],"date-time":"2025-12-09T20:10:16Z","timestamp":1765311016853,"version":"3.46.0"},"publisher-location":"New York, NY, USA","reference-count":46,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3755590","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T07:30:51Z","timestamp":1761377451000},"page":"631-640","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Self-Supervised Vision Graph Neural Networks Based on Contrastive Learning"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-8372-4069","authenticated-orcid":false,"given":"Yuzhen","family":"Li","sequence":"first","affiliation":[{"name":"Nanjing University of Science and Technology, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-2458-2980","authenticated-orcid":false,"given":"Yuehui","family":"Han","sequence":"additional","affiliation":[{"name":"Nanjing University of Information Science and Technology, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0968-8556","authenticated-orcid":false,"given":"Jianjun","family":"Qian","sequence":"additional","affiliation":[{"name":"Nanjing University of Science and Techonology, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4800-832X","authenticated-orcid":false,"given":"Jian","family":"Yang","sequence":"additional","affiliation":[{"name":"Nanjing University of Science and Technology, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"End-to-End Object Detection with Transformers. ArXiv","author":"Carion Nicolas","year":"2020","unstructured":"Nicolas Carion, Francisco Massa, Gabriel Synnaeve, Nicolas Usunier, Alexander Kirillov, and Sergey Zagoruyko. 2020. End-to-End Object Detection with Transformers. ArXiv, Vol. abs\/2005.12872 (2020). https:\/\/api.semanticscholar.org\/CorpusID:218889832"},{"key":"e_1_3_2_1_2_1","volume-title":"Unsupervised Learning of Visual Features by Contrasting Cluster Assignments. ArXiv","author":"Caron Mathilde","year":"2020","unstructured":"Mathilde Caron, Ishan Misra, Julien Mairal, Priya Goyal, Piotr Bojanowski, and Armand Joulin. 2020. Unsupervised Learning of Visual Features by Contrasting Cluster Assignments. ArXiv, Vol. abs\/2006.09882 (2020). https:\/\/api.semanticscholar.org\/CorpusID:219721240"},{"key":"e_1_3_2_1_3_1","first-page":"9630","volume-title":"Emerging Properties in Self-Supervised Vision Transformers. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"Caron Mathilde","year":"2021","unstructured":"Mathilde Caron, Hugo Touvron, Ishan Misra, Herv'e J'egou, Julien Mairal, Piotr Bojanowski, and Armand Joulin. 2021. Emerging Properties in Self-Supervised Vision Transformers. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV) (2021), 9630-9640. https:\/\/api.semanticscholar.org\/CorpusID:233444273"},{"key":"e_1_3_2_1_4_1","volume-title":"Hinton","author":"Chen Ting","year":"2020","unstructured":"Ting Chen, Simon Kornblith, Mohammad Norouzi, and Geoffrey E. Hinton. 2020b. A Simple Framework for Contrastive Learning of Visual Representations. ArXiv, Vol. abs\/2002.05709 (2020). https:\/\/api.semanticscholar.org\/CorpusID:211096730"},{"key":"e_1_3_2_1_5_1","volume-title":"Improved Baselines with Momentum Contrastive Learning. ArXiv","author":"Chen Xinlei","year":"2020","unstructured":"Xinlei Chen, Haoqi Fan, Ross B. Girshick, and Kaiming He. 2020a. Improved Baselines with Momentum Contrastive Learning. ArXiv, Vol. abs\/2003.04297 (2020). https:\/\/api.semanticscholar.org\/CorpusID:212633993"},{"key":"e_1_3_2_1_6_1","first-page":"15745","volume-title":"Exploring Simple Siamese Representation Learning. 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2020","author":"Chen Xinlei","year":"2020","unstructured":"Xinlei Chen and Kaiming He. 2020. Exploring Simple Siamese Representation Learning. 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2020), 15745-15753. https:\/\/api.semanticscholar.org\/CorpusID:227118869"},{"key":"e_1_3_2_1_7_1","first-page":"9620","volume-title":"An Empirical Study of Training Self-Supervised Vision Transformers. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"Chen Xinlei","year":"2021","unstructured":"Xinlei Chen, Saining Xie, and Kaiming He. 2021. An Empirical Study of Training Self-Supervised Vision Transformers. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV) (2021), 9620-9629. https:\/\/api.semanticscholar.org\/CorpusID:233024948"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"e_1_3_2_1_9_1","first-page":"12114","volume-title":"CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Dong Xiaoyi","year":"2021","unstructured":"Xiaoyi Dong, Jianmin Bao, Dongdong Chen, Weiming Zhang, Nenghai Yu, Lu Yuan, Dong Chen, and Baining Guo. 2021. CSWin Transformer: A General Vision Transformer Backbone with Cross-Shaped Windows. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2021), 12114-12124. https:\/\/api.semanticscholar.org\/CorpusID:235694312"},{"key":"e_1_3_2_1_10_1","volume-title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ArXiv","author":"Dosovitskiy Alexey","year":"1929","unstructured":"Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, and Neil Houlsby. 2020. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ArXiv, Vol. abs\/2010.11929 (2020). https:\/\/api.semanticscholar.org\/CorpusID:225039882"},{"key":"e_1_3_2_1_11_1","volume-title":"Mohammad Gheshlaghi Azar, Bilal Piot, Koray Kavukcuoglu, R\u00e9mi Munos, and Michal Valko.","author":"Grill Jean-Bastien","year":"2020","unstructured":"Jean-Bastien Grill, Florian Strub, Florent Altch'e, Corentin Tallec, Pierre H. Richemond, Elena Buchatskaya, Carl Doersch, Bernardo \u00c1vila Pires, Zhaohan Daniel Guo, Mohammad Gheshlaghi Azar, Bilal Piot, Koray Kavukcuoglu, R\u00e9mi Munos, and Michal Valko. 2020. Bootstrap Your Own Latent: A New Approach to Self-Supervised Learning. ArXiv, Vol. abs\/2006.07733 (2020). https:\/\/api.semanticscholar.org\/CorpusID:219687798"},{"key":"e_1_3_2_1_12_1","volume-title":"Vision GNN: An Image is Worth Graph of Nodes. ArXiv","author":"Han Kai","year":"2022","unstructured":"Kai Han, Yunhe Wang, Jianyuan Guo, Yehui Tang, and Enhua Wu. 2022. Vision GNN: An Image is Worth Graph of Nodes. ArXiv, Vol. abs\/2206.00272 (2022). https:\/\/api.semanticscholar.org\/CorpusID:249240094"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01820"},{"key":"e_1_3_2_1_14_1","first-page":"9726","volume-title":"Momentum Contrast for Unsupervised Visual Representation Learning. 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2019","author":"He Kaiming","year":"2079","unstructured":"Kaiming He, Haoqi Fan, Yuxin Wu, Saining Xie, and Ross B. Girshick. 2019. Momentum Contrast for Unsupervised Visual Representation Learning. 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2019), 9726-9735. https:\/\/api.semanticscholar.org\/CorpusID:207930212"},{"key":"e_1_3_2_1_15_1","first-page":"770","volume-title":"Deep Residual Learning for Image Recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015","author":"He Kaiming","year":"2015","unstructured":"Kaiming He, X. Zhang, Shaoqing Ren, and Jian Sun. 2015. Deep Residual Learning for Image Recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2015), 770-778. https:\/\/api.semanticscholar.org\/CorpusID:206594692"},{"key":"e_1_3_2_1_16_1","volume-title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications. ArXiv","author":"Howard Andrew G.","year":"2017","unstructured":"Andrew G. Howard, Menglong Zhu, Bo Chen, Dmitry Kalenichenko, Weijun Wang, Tobias Weyand, Marco Andreetto, and Hartwig Adam. 2017. MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications. ArXiv, Vol. abs\/1704.04861 (2017). https:\/\/api.semanticscholar.org\/CorpusID:12670695"},{"key":"e_1_3_2_1_17_1","volume-title":"No'e Pion, Philippe Weinzaepfel, and Diane Larlus.","author":"Kalantidis Yannis","year":"2020","unstructured":"Yannis Kalantidis, Mert Bulent Sariyildiz, No'e Pion, Philippe Weinzaepfel, and Diane Larlus. 2020. Hard Negative Mixing for Contrastive Learning. ArXiv, Vol. abs\/2010.01028 (2020). https:\/\/api.semanticscholar.org\/CorpusID:222124996"},{"key":"e_1_3_2_1_18_1","unstructured":"Alex Krizhevsky. 2009. Learning Multiple Layers of Features from Tiny Images. https:\/\/api.semanticscholar.org\/CorpusID:18268744"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1145\/3065386"},{"key":"e_1_3_2_1_20_1","first-page":"4558","volume-title":"Large-Scale Point Cloud Semantic Segmentation with Superpoint Graphs. 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Landrieu Loic","year":"2017","unstructured":"Loic Landrieu and Martin Simonovsky. 2017. Large-Scale Point Cloud Semantic Segmentation with Superpoint Graphs. 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (2017), 4558-4567. https:\/\/api.semanticscholar.org\/CorpusID:4396837"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/5.726791"},{"key":"e_1_3_2_1_22_1","volume-title":"International Conference on Learning Representations. https:\/\/api.semanticscholar.org\/CorpusID:234685335","author":"Lee Kibok","year":"2021","unstructured":"Kibok Lee, Yian Zhu, Kihyuk Sohn, Chun-Liang Li, Jinwoo Shin, and Honglak Lee. 2021. i-Mix: A Domain-Agnostic Strategy for Contrastive Representation Learning. In International Conference on Learning Representations. https:\/\/api.semanticscholar.org\/CorpusID:234685335"},{"volume-title":"Microsoft COCO: Common Objects in Context. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:14113767","author":"Lin Tsung-Yi","key":"e_1_3_2_1_23_1","unstructured":"Tsung-Yi Lin, Michael Maire, Serge J. Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll\u00e1r, and C. Lawrence Zitnick. 2014. Microsoft COCO: Common Objects in Context. In European Conference on Computer Vision. https:\/\/api.semanticscholar.org\/CorpusID:14113767"},{"key":"e_1_3_2_1_24_1","first-page":"11999","volume-title":"2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Liu Ze","year":"2021","unstructured":"Ze Liu, Han Hu, Yutong Lin, Zhuliang Yao, Zhenda Xie, Yixuan Wei, Jia Ning, Yue Cao, Zheng Zhang, Li Dong, Furu Wei, and Baining Guo. 2021a. Swin Transformer V2: Scaling Up Capacity and Resolution. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2021), 11999-12009. https:\/\/api.semanticscholar.org\/CorpusID:244346076"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"e_1_3_2_1_27_1","first-page":"2211","volume-title":"MobileViG: Graph-Based Sparse Attention for Mobile Vision Applications. 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)","author":"Munir Mustafa","year":"2023","unstructured":"Mustafa Munir, William Avery, and Radu Marculescu. 2023. MobileViG: Graph-Based Sparse Attention for Mobile Vision Applications. 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) (2023), 2211-2219. https:\/\/api.semanticscholar.org\/CorpusID:259317049"},{"key":"e_1_3_2_1_28_1","first-page":"6118","volume-title":"GreedyViG: Dynamic Axial Graph Construction for Efficient Vision GNNs. 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Munir Mustafa","year":"2024","unstructured":"Mustafa Munir, William Avery, Md Mostafijur Rahman, and Radu Marculescu. 2024. GreedyViG: Dynamic Axial Graph Construction for Efficient Vision GNNs. 2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2024), 6118-6127. https:\/\/api.semanticscholar.org\/CorpusID:269757862"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01419"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00474"},{"key":"e_1_3_2_1_32_1","volume-title":"Inter-Instance Similarity Modeling for Contrastive Learning. ArXiv","author":"Shen Chen","year":"2023","unstructured":"Chen Shen, Dawei Liu, Hao Tang, Zhe Qu, and Jianxin Wang. 2023. Inter-Instance Similarity Modeling for Contrastive Learning. ArXiv, Vol. abs\/2306.12243 (2023). https:\/\/api.semanticscholar.org\/CorpusID:259211945"},{"volume-title":"Un-mix: Rethinking Image Mixtures for Unsupervised Visual Representation Learning. In AAAI Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:245329909","author":"Shen Zhiqiang","key":"e_1_3_2_1_33_1","unstructured":"Zhiqiang Shen, Zechun Liu, Zhuang Liu, Marios Savvides, Trevor Darrell, and Eric P. Xing. 2020. Un-mix: Rethinking Image Mixtures for Unsupervised Visual Representation Learning. In AAAI Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:245329909"},{"key":"e_1_3_2_1_34_1","volume-title":"Le","author":"Tan Mingxing","year":"2019","unstructured":"Mingxing Tan and Quoc V. Le. 2019. EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks. ArXiv, Vol. abs\/1905.11946 (2019). https:\/\/api.semanticscholar.org\/CorpusID:167217261"},{"volume-title":"International Conference on Machine Learning. https:\/\/api.semanticscholar.org\/CorpusID:232478903","author":"Tan Mingxing","key":"e_1_3_2_1_35_1","unstructured":"Mingxing Tan and Quoc V. Le. 2021. EfficientNetV2: Smaller Models and Faster Training. In International Conference on Machine Learning. https:\/\/api.semanticscholar.org\/CorpusID:232478903"},{"key":"e_1_3_2_1_36_1","volume-title":"Le","author":"Verma Vikas","year":"2020","unstructured":"Vikas Verma, Minh-Thang Luong, Kenji Kawaguchi, Hieu Pham, and Quoc V. Le. 2020. Towards Domain-Agnostic Contrastive Learning. ArXiv, Vol. abs\/2011.04419 (2020). https:\/\/api.semanticscholar.org\/CorpusID:226282067"},{"key":"e_1_3_2_1_37_1","unstructured":"Oriol Vinyals Charles Blundell Timothy P. Lillicrap Koray Kavukcuoglu and Daan Wierstra. 2016. Matching Networks for One Shot Learning. In Neural Information Processing Systems. https:\/\/api.semanticscholar.org\/CorpusID:8909022"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00061"},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3326362","article-title":"Dynamic Graph CNN for Learning on Point Clouds","volume":"38","author":"Wang Yue","year":"2018","unstructured":"Yue Wang, Yongbin Sun, Ziwei Liu, Sanjay E. Sarma, Michael M. Bronstein, and Justin M. Solomon. 2018. Dynamic Graph CNN for Learning on Point Clouds. ACM Transactions on Graphics (TOG), Vol. 38 (2018), 1 - 12. https:\/\/api.semanticscholar.org\/CorpusID:94822","journal-title":"ACM Transactions on Graphics (TOG)"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612122"},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00393"},{"key":"e_1_3_2_1_42_1","volume-title":"Spatial Temporal Graph Convolutional Networks for Skeleton-Based Action Recognition. In AAAI Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:19167105","author":"Yan Sijie","year":"2018","unstructured":"Sijie Yan, Yuanjun Xiong, and Dahua Lin. 2018. Spatial Temporal Graph Convolutional Networks for Skeleton-Based Action Recognition. In AAAI Conference on Artificial Intelligence. https:\/\/api.semanticscholar.org\/CorpusID:19167105"},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00612"},{"key":"e_1_3_2_1_44_1","volume-title":"mixup: Beyond Empirical Risk Minimization. ArXiv","author":"Zhang Hongyi","year":"2017","unstructured":"Hongyi Zhang, Moustapha Ciss\u00e9, Yann Dauphin, and David Lopez-Paz. 2017. mixup: Beyond Empirical Risk Minimization. ArXiv, Vol. abs\/1710.09412 (2017). https:\/\/api.semanticscholar.org\/CorpusID:3162051"},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.544"},{"key":"e_1_3_2_1_46_1","volume-title":"Alan Loddon Yuille, and Tao Kong","author":"Zhou Jinghao","year":"2021","unstructured":"Jinghao Zhou, Chen Wei, Huiyu Wang, Wei Shen, Cihang Xie, Alan Loddon Yuille, and Tao Kong. 2021. iBOT: Image BERT Pre-Training with Online Tokenizer. ArXiv, Vol. abs\/2111.07832 (2021). https:\/\/api.semanticscholar.org\/CorpusID:244117494"}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Dublin Ireland","acronym":"MM '25"},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3755590","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,9]],"date-time":"2025-12-09T20:05:43Z","timestamp":1765310743000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3755590"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":46,"alternative-id":["10.1145\/3746027.3755590","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3755590","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}