{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,29]],"date-time":"2026-06-29T05:46:41Z","timestamp":1782712001735,"version":"3.54.5"},"reference-count":43,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T00:00:00Z","timestamp":1780358400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2026,6,3]],"date-time":"2026-06-03T00:00:00Z","timestamp":1780444800000},"content-version":"vor","delay-in-days":1,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Process Lett"],"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:p>Fine-grained image classification remains challenging due to high intra-class variation and strong inter-class similarity, which make it difficult to obtain well-structured output distributions. While most existing approaches address this problem through spatial modeling or feature-level representation learning, output-level processing remains relatively underexplored despite its scalability across backbone architectures. To address this limitation, this paper proposes a self-calibrated mutual learning framework that improves performance in fine-grained contexts by reshaping output distribution geometry through the interaction between cross-model consistency and self-calibration. Cross-model consistency is achieved via deep mutual learning, while self-calibration is induced using online label smoothing. Unlike a simple combination of two loss terms, the proposed framework jointly enforces sample-wise consistency and class-wise target regularization within a unified probability space. Experiments on three benchmark datasets across multiple backbone architectures demonstrate that the proposed method consistently improves classification accuracy over existing output-level mutual learning methods and produces a complementary effect beyond their individual contributions.<\/jats:p>","DOI":"10.1007\/s11063-026-11864-z","type":"journal-article","created":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T16:35:00Z","timestamp":1780418100000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Self-Calibrated Mutual Learning for Fine-Grained Image Recognition"],"prefix":"10.1007","volume":"58","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-0039-0623","authenticated-orcid":false,"given":"Jung-Ha","family":"Hwang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4950-8863","authenticated-orcid":false,"given":"Doo-Hyun","family":"Choi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,6,2]]},"reference":[{"key":"11864_CR1","unstructured":"Wah C, Branson S, Welinder P, et al (2011) The Caltech-UCSD Birds-200\u20132011 Dataset"},{"key":"11864_CR2","doi-asserted-by":"crossref","unstructured":"Nilsback M-E, Zisserman A (2008) Automated flower classification over a large number of classes. In: 2008 Sixth Indian Conference on Computer Vision, Graphics & Image Processing. IEEE, Bhubaneswar, India, 722\u2013729","DOI":"10.1109\/ICVGIP.2008.47"},{"key":"11864_CR3","first-page":"3498","volume-title":"2012 IEEE Conference on Computer Vision and Pattern Recognition","author":"P OmkarM","year":"2012","unstructured":"OmkarM P, Vedaldi A, Zisserman A, Jawahar CV (2012) Cats and dogs. 2012 IEEE Conference on Computer Vision and Pattern Recognition. IEEE, Providence, RI, pp 3498\u20133505"},{"key":"11864_CR4","doi-asserted-by":"publisher","first-page":"1153","DOI":"10.1109\/CVPR.2016.130","volume-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Y Cui","year":"2016","unstructured":"Cui Y, Zhou F, Lin Y, Belongie S (2016) Fine-grained categorization and dataset bootstrapping using deep metric learning with humans in the loop. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Las Vegas, NV, USA, pp 1153\u20131162"},{"key":"11864_CR5","doi-asserted-by":"publisher","first-page":"2645","DOI":"10.1109\/CVPR.2015.7298880","volume-title":"2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"S Xie","year":"2015","unstructured":"Xie S, Yang T, Wang X, Lin Y (2015) Hyper-class augmented and regularized deep learning for fine-grained image classification. 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Boston, MA, USA, pp 2645\u20132654"},{"key":"11864_CR6","doi-asserted-by":"publisher","first-page":"7332","DOI":"10.1109\/CVPR.2017.775","volume-title":"2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"X He","year":"2017","unstructured":"He X, Peng Y (2017) Fine-grained image classification via combining vision and language. 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Honolulu, HI, pp 7332\u20137340"},{"key":"11864_CR7","doi-asserted-by":"publisher","first-page":"4476","DOI":"10.1109\/CVPR.2017.476","volume-title":"2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"J Fu","year":"2017","unstructured":"Fu J, Zheng H, Mei T (2017) Look closer to see better: Recurrent attention convolutional neural network for fine-grained image Recognition. 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Honolulu, HI, pp 4476\u20134484"},{"key":"11864_CR8","first-page":"5209","volume-title":"2017 IEEE International Conference on Computer Vision (ICCV)","author":"H Zheng","year":"2017","unstructured":"Zheng H, Fu J, Mei T, Luo J (2017) Learning multi-attention convolutional neural network for fine-grained image recognition. 2017 IEEE International Conference on Computer Vision (ICCV). IEEE, Venice, pp 5209\u20135217"},{"key":"11864_CR9","doi-asserted-by":"publisher","first-page":"438","DOI":"10.1007\/978-3-030-01264-9_26","volume-title":"Computer vision \u2013 ECCV 2018","author":"Z Yang","year":"2018","unstructured":"Yang Z, Luo T, Wang D et al (2018) Learning to navigate for fine-grained classification. In: Ferrari V, Hebert M, Sminchisescu C, Weiss Y (eds) Computer vision \u2013 ECCV 2018. Springer International Publishing, Cham, pp 438\u2013454"},{"key":"11864_CR10","doi-asserted-by":"crossref","unstructured":"Sun S, Ren W, Li J, et al (2024) Logit Standardization in knowledge distillation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. 15731\u201315740","DOI":"10.1109\/CVPR52733.2024.01489"},{"key":"11864_CR11","doi-asserted-by":"crossref","unstructured":"Sun W, Chen D, Lyu S, et al (2025) Knowledge distillation with refined logits. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. 1110\u20131119","DOI":"10.1109\/ICCV51701.2025.00111"},{"key":"11864_CR12","first-page":"2184","volume":"33","author":"Z Zhang","year":"2020","unstructured":"Zhang Z, Sabuncu MR (2020) Self-distillation as instance-specific label smoothing. Adv Neural Inf Process Syst 33:2184\u20132195","journal-title":"Adv Neural Inf Process Syst"},{"key":"11864_CR13","first-page":"13876","volume-title":"2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"S Yun","year":"2020","unstructured":"Yun S, Park J, Lee K, Shin J (2020) Regularizing class-wise predictions via self-knowledge distillzation. 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Seattle, WA, USA, pp 13876\u201313885"},{"key":"11864_CR14","doi-asserted-by":"publisher","first-page":"5984","DOI":"10.1109\/TIP.2021.3089942","volume":"30","author":"C-B Zhang","year":"2021","unstructured":"Zhang C-B, Jiang P-T, Hou Q et al (2021) Delving deep into label smoothing. IEEE Trans Image Process 30:5984\u20135996. https:\/\/doi.org\/10.1109\/TIP.2021.3089942","journal-title":"IEEE Trans Image Process"},{"key":"11864_CR15","doi-asserted-by":"publisher","first-page":"4320","DOI":"10.1109\/CVPR.2018.00454","volume-title":"2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Y Zhang","year":"2018","unstructured":"Zhang Y, Xiang T, Hospedales TM, Lu H (2018) Deep mutual learning. 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition. IEEE, Salt Lake City, UT, pp 4320\u20134328"},{"key":"11864_CR16","doi-asserted-by":"publisher","first-page":"1314","DOI":"10.1109\/ICCV.2019.00140","volume-title":"2019 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"A Howard","year":"2019","unstructured":"Howard A, Sandler M, Chu G et al (2019) Searching for MobileNetV3. 2019 IEEE\/CVF International Conference on Computer Vision (ICCV). IEEE, Seoul, Korea (South), pp 1314\u20131324"},{"key":"11864_CR17","doi-asserted-by":"publisher","first-page":"7907","DOI":"10.1109\/CVPR52729.2023.00764","volume-title":"2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"PKA Vasu","year":"2023","unstructured":"Vasu PKA, Gabriel J, Zhu J et al (2023) MobileOne: An improved one millisecond mobile backbone. 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Vancouver, BC, Canada, pp 7907\u20137917"},{"key":"11864_CR18","doi-asserted-by":"publisher","first-page":"770","DOI":"10.1109\/CVPR.2016.90","volume-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"K He","year":"2016","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Las Vegas, NV, USA, pp 770\u2013778"},{"key":"11864_CR19","doi-asserted-by":"publisher","first-page":"1449","DOI":"10.1109\/ICCV.2015.170","volume-title":"2015 IEEE International Conference on Computer Vision (ICCV)","author":"T-Y Lin","year":"2015","unstructured":"Lin T-Y, RoyChowdhury A, Maji S (2015) Bilinear CNN models for fine-grained visual recognition. 2015 IEEE International Conference on Computer Vision (ICCV). IEEE, Santiago, Chile, pp 1449\u20131457"},{"key":"11864_CR20","doi-asserted-by":"publisher","first-page":"5007","DOI":"10.1109\/CVPR.2019.00515","volume-title":"2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"H Zheng","year":"2019","unstructured":"Zheng H, Fu J, Zha Z-J, Luo J (2019) Looking for the devil in the details: Learning trilinear attention sampling network for fine-grained image recognition. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Long Beach, CA, USA, pp 5007\u20135016"},{"key":"11864_CR21","doi-asserted-by":"publisher","first-page":"834","DOI":"10.1007\/978-3-030-01270-0_49","volume-title":"Computer vision \u2013 ECCV 2018","author":"M Sun","year":"2018","unstructured":"Sun M, Yuan Y, Zhou F, Ding E (2018) Multi-attention multi-class constraint for fine-grained image recognition. In: Ferrari V, Hebert M, Sminchisescu C, Weiss Y (eds) Computer vision \u2013 ECCV 2018. Springer International Publishing, Cham, pp 834\u2013850"},{"key":"11864_CR22","doi-asserted-by":"publisher","first-page":"15074","DOI":"10.1109\/CVPR46437.2021.01483","volume-title":"2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Y Zhao","year":"2021","unstructured":"Zhao Y, Yan K, Huang F, Li J (2021) Graph-based high-order relation discovery for fine-grained recognition. 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Nashville, TN, USA, pp 15074\u201315083"},{"key":"11864_CR23","doi-asserted-by":"publisher","first-page":"4683","DOI":"10.1109\/TIP.2020.2973812","volume":"29","author":"D Chang","year":"2020","unstructured":"Chang D, Ding Y, Xie J et al (2020) The devil is in the channels: Mutual-channel loss for fine-grained image classification. IEEE Trans on Image Process 29:4683\u20134695. https:\/\/doi.org\/10.1109\/TIP.2020.2973812","journal-title":"IEEE Trans on Image Process"},{"key":"11864_CR24","doi-asserted-by":"publisher","first-page":"9954","DOI":"10.1109\/TCSVT.2024.3406443","volume":"34","author":"H Yao","year":"2024","unstructured":"Yao H, Miao Q, Zhao P et al (2024) Exploration of class center for fine-grained visual classification. IEEE Trans Circuits Syst Video Technol 34:9954\u20139966. https:\/\/doi.org\/10.1109\/TCSVT.2024.3406443","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"11864_CR25","unstructured":"Hinton G, Vinyals O, Dean J (2015) Distilling the knowledge in a neural network"},{"key":"11864_CR26","first-page":"4498","volume-title":"ICASSP 2022\u20132022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"H Zhang","year":"2022","unstructured":"Zhang H, Chen D, Wang C (2022) Confidence-aware multi-teacher knowledge distillation. ICASSP 2022\u20132022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, Singapore, Singapore, pp 4498\u20134502"},{"key":"11864_CR27","unstructured":"Anil R, Pereyra G, Passos A, et al (2020) Large scale distributed neural network training through online distillation"},{"key":"11864_CR28","first-page":"11020","volume-title":"2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Q Guo","year":"2020","unstructured":"Guo Q, Wang X, Wu Y et al (2020) Online knowledge distillation via collaborative learning. 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Seattle, WA, USA, pp 11020\u201311029"},{"key":"11864_CR29","doi-asserted-by":"publisher","first-page":"3045","DOI":"10.1609\/aaai.v36i3.20211","volume":"36","author":"C Yang","year":"2022","unstructured":"Yang C, An Z, Cai L, Xu Y (2022) Mutual contrastive learning for visual representation learning. AAAI 36:3045\u20133053. https:\/\/doi.org\/10.1609\/aaai.v36i3.20211","journal-title":"AAAI"},{"key":"11864_CR30","doi-asserted-by":"publisher","first-page":"10212","DOI":"10.1109\/TPAMI.2023.3257878","volume":"45","author":"C Yang","year":"2023","unstructured":"Yang C, An Z, Zhou H et al (2023) Online knowledge distillation via mutual contrastive learning for visual recognition. IEEE Trans Pattern Anal Mach Intell 45:10212\u201310227. https:\/\/doi.org\/10.1109\/TPAMI.2023.3257878","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"11864_CR31","doi-asserted-by":"publisher","first-page":"7901","DOI":"10.1109\/TMM.2024.3372833","volume":"26","author":"J Gou","year":"2024","unstructured":"Gou J, Chen Y, Yu B et al (2024) Reciprocal teacher-student learning via forward and feedback knowledge distillation. IEEE Trans Multimedia 26:7901\u20137916. https:\/\/doi.org\/10.1109\/TMM.2024.3372833","journal-title":"IEEE Trans Multimedia"},{"key":"11864_CR32","doi-asserted-by":"publisher","first-page":"107404","DOI":"10.1016\/j.neunet.2025.107404","volume":"188","author":"J Gou","year":"2025","unstructured":"Gou J, Lin J, Li L et al (2025) Intra-class progressive and adaptive self-distillation. Neural Netw 188:107404. https:\/\/doi.org\/10.1016\/j.neunet.2025.107404","journal-title":"Neural Netw"},{"key":"11864_CR33","first-page":"11943","volume-title":"2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Y Shen","year":"2022","unstructured":"Shen Y, Xu L, Yang Y et al (2022) Self-distillation from the Last mini-batch for consistency regularization. 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, New Orleans, LA, USA, pp 11943\u201311952"},{"key":"11864_CR34","unstructured":"Furlanello T, Lipton ZC, Tschannen M, et al (2018) Born-again neural networks. In: Proceedings of Machine Learning Research. 1607\u20131616"},{"key":"11864_CR35","first-page":"2859","volume-title":"2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"C Yang","year":"2019","unstructured":"Yang C, Xie L, Su C, Yuille AL (2019) Snapshot distillation: teacher-student optimization in one generation. 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Long Beach, CA, USA, pp 2859\u20132868"},{"key":"11864_CR36","first-page":"6567","volume-title":"2021 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"K Kim","year":"2021","unstructured":"Kim K, Ji B, Yoon D, Hwang S (2021) Self-knowledge distillation with progressive refinement of targets. 2021 IEEE\/CVF International Conference on Computer Vision (ICCV). IEEE, Montreal, QC, Canada, pp 6567\u20136576"},{"key":"11864_CR37","doi-asserted-by":"publisher","first-page":"106215","DOI":"10.1016\/j.neunet.2024.106215","volume":"174","author":"M Liu","year":"2024","unstructured":"Liu M, Yu Y, Ji Z et al (2024) Tolerant self-distillation for image classification. Neural Netw 174:106215. https:\/\/doi.org\/10.1016\/j.neunet.2024.106215","journal-title":"Neural Netw"},{"key":"11864_CR38","doi-asserted-by":"publisher","first-page":"2544","DOI":"10.1109\/CVPR46437.2021.00257","volume-title":"2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Y Liu","year":"2021","unstructured":"Liu Y, Schiele B, Sun Q (2021) Adaptive aggregation networks for class-incremental learning. 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, Nashville, TN, USA, pp 2544\u20132553"},{"key":"11864_CR39","first-page":"3713","volume-title":"2019 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"L Zhang","year":"2019","unstructured":"Zhang L, Song J, Gao A et al (2019) Be your own teacher: improve the performance of convolutional neural networks via self distillation. 2019 IEEE\/CVF International Conference on Computer Vision (ICCV). IEEE, Seoul, Korea (South), pp 3713\u20133722"},{"key":"11864_CR40","unstructured":"Kingma DP, Ba JL (2017) Adam: A method for stochastic optimization"},{"key":"11864_CR41","doi-asserted-by":"publisher","first-page":"6371","DOI":"10.1109\/TCSVT.2025.3541588","volume":"35","author":"M Song","year":"2025","unstructured":"Song M, Chen C, Song W, Fang Y (2025) UNI-IQA: A unified approach for mutual promotion of natural and screen content image quality assessment. IEEE Trans Circuits Syst Video Technol 35:6371\u20136385. https:\/\/doi.org\/10.1109\/TCSVT.2025.3541588","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"11864_CR42","doi-asserted-by":"publisher","first-page":"6124","DOI":"10.1109\/TIP.2022.3205747","volume":"31","author":"M Song","year":"2022","unstructured":"Song M, Song W, Yang G, Chen C (2022) Improving RGB-D salient object detection via modality-aware decoder. IEEE Trans Image Process 31:6124\u20136138. https:\/\/doi.org\/10.1109\/TIP.2022.3205747","journal-title":"IEEE Trans Image Process"},{"key":"11864_CR43","doi-asserted-by":"publisher","first-page":"103349","DOI":"10.1016\/j.inffus.2025.103349","volume":"124","author":"S Liang","year":"2025","unstructured":"Liang S, Guan R, Lian W et al (2025) Cognitive disentanglement for referring multi-object tracking. Inf Fusion 124:103349. https:\/\/doi.org\/10.1016\/j.inffus.2025.103349","journal-title":"Inf Fusion"}],"container-title":["Neural Processing Letters"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11063-026-11864-z","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11063-026-11864-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11063-026-11864-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,29]],"date-time":"2026-06-29T05:25:09Z","timestamp":1782710709000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11063-026-11864-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,2]]},"references-count":43,"journal-issue":{"issue":"3","published-online":{"date-parts":[[2026,6]]}},"alternative-id":["11864"],"URL":"https:\/\/doi.org\/10.1007\/s11063-026-11864-z","relation":{"has-preprint":[{"id-type":"doi","id":"10.21203\/rs.3.rs-8942212\/v1","asserted-by":"object"}]},"ISSN":["1573-773X"],"issn-type":[{"value":"1573-773X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,6,2]]},"assertion":[{"value":"23 February 2026","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 May 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"2 June 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing Interests"}}],"article-number":"42"}}