{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T15:31:48Z","timestamp":1785857508390,"version":"3.56.0"},"reference-count":46,"publisher":"Springer Science and Business Media LLC","issue":"17-18","license":[{"start":{"date-parts":[[2024,6,14]],"date-time":"2024-06-14T00:00:00Z","timestamp":1718323200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,6,14]],"date-time":"2024-06-14T00:00:00Z","timestamp":1718323200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2024,9]]},"DOI":"10.1007\/s10489-024-05598-5","type":"journal-article","created":{"date-parts":[[2024,6,14]],"date-time":"2024-06-14T07:04:09Z","timestamp":1718348649000},"page":"7793-7809","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":13,"title":["A lightweight convolutional swin transformer with cutmix augmentation and CBAM attention for compound emotion recognition"],"prefix":"10.1007","volume":"54","author":[{"family":"Nidhi","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bindu","family":"Verma","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,6,14]]},"reference":[{"key":"5598_CR1","unstructured":"Mehrabian A (1981) Silent messages: implicit communication of emotions and attitudes. Wadsworth Pub, Co"},{"issue":"1","key":"5598_CR2","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1177\/002383099403700101","volume":"37","author":"EA Boyle","year":"1994","unstructured":"Boyle EA, Anderson AH, Newlands A (1994) The effects of visibility on dialogue and performance in a cooperative problem solving task. Lang Speech 37(1):1\u201320","journal-title":"Lang Speech"},{"issue":"2","key":"5598_CR3","doi-asserted-by":"publisher","first-page":"113","DOI":"10.1111\/j.2044-8260.1976.tb00016.x","volume":"15","author":"G Stephenson","year":"1976","unstructured":"Stephenson G, Ayling K, Rutter D (1976) The role of visual communication in social exchange. Br J Soc Clin Psychol 15(2):113\u2013120","journal-title":"Br J Soc Clin Psychol"},{"key":"5598_CR4","doi-asserted-by":"publisher","first-page":"26391","DOI":"10.1109\/ACCESS.2018.2831927","volume":"6","author":"J Guo","year":"2018","unstructured":"Guo J, Lei Z, Wan J, Avots E, Hajarolasvadi N, Knyazev B, Kuharenko A, Junior JCSJ, Baro X, Demirel H et al (2018) Dominant and complementary emotion recognition from still images of faces. IEEE Access 6:26391\u201326403","journal-title":"IEEE Access"},{"issue":"2","key":"5598_CR5","doi-asserted-by":"publisher","first-page":"151","DOI":"10.1177\/1754073914554775","volume":"7","author":"A Bellocchi","year":"2015","unstructured":"Bellocchi A (2015) Methods for sociological inquiry on emotion in educational settings. Emot Rev 7(2):151\u2013156","journal-title":"Emot Rev"},{"key":"5598_CR6","doi-asserted-by":"crossref","unstructured":"Loob C, Rasti P, L\u00fcsi I, Jacques JC, Bar\u00f3 X, Escalera S, Sapinski T, Kaminska D, Anbarjafari G (2017) Dominant and complementary multi-emotional facial expression recognition using c-support vector classification. In: 2017 12th IEEE International conference on automatic face & gesture recognition (FG 2017), pp 833\u2013838. IEEE","DOI":"10.1109\/FG.2017.106"},{"key":"5598_CR7","doi-asserted-by":"crossref","unstructured":"Fabian Benitez-Quiroz C, Srinivasan R, Martinez AM (2016) Emotionet: An accurate, real-time algorithm for the automatic annotation of a million facial expressions in the wild. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 5562\u20135570","DOI":"10.1109\/CVPR.2016.600"},{"key":"5598_CR8","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez A.N, Kaiser \u0141, Polosukhin I (2017) Attention is all you need. Advances in neural information processing systems 30"},{"key":"5598_CR9","doi-asserted-by":"crossref","unstructured":"Liu Z, Lin Y, Cao Y, Hu H, Wei Y, Zhang Z, Lin S, Guo B (2021) Swin transformer: Hierarchical vision transformer using shifted windows. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 10012\u201310022","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"5598_CR10","doi-asserted-by":"crossref","unstructured":"Woo S, Park J, Lee J-Y, Kweon IS (2018) Cbam: Convolutional block attention module. In: Proceedings of the european conference on computer vision (ECCV), pp 3\u201319","DOI":"10.1007\/978-3-030-01234-2_1"},{"issue":"1","key":"5598_CR11","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11263-019-01215-y","volume":"128","author":"Y Luo","year":"2020","unstructured":"Luo Y, Ye J, Adams RB, Li J, Newman MG, Wang JZ (2020) Arbee: Towards automated recognition of bodily expression of emotion in the wild. Int J Comput Vis 128(1):1\u201325","journal-title":"Int J Comput Vis"},{"issue":"4","key":"5598_CR12","doi-asserted-by":"publisher","first-page":"384","DOI":"10.1037\/0003-066X.48.4.384","volume":"48","author":"P Ekman","year":"1993","unstructured":"Ekman P (1993) Facial expression and emotion. Am Psychol 48(4):384","journal-title":"Am Psychol"},{"issue":"1","key":"5598_CR13","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1038\/s41598-018-35259-w","volume":"8","author":"MG Calvo","year":"2018","unstructured":"Calvo MG, Fern\u00e1ndez-Mart\u00edn A, Guti\u00e9rrez-Garc\u00eda A, Lundqvist D (2018) Selective eye fixations on diagnostic face regions of dynamic emotional expressions: Kdef-dyn database. Sci Rep 8(1):1\u201310","journal-title":"Sci Rep"},{"key":"5598_CR14","doi-asserted-by":"publisher","first-page":"168865","DOI":"10.1109\/ACCESS.2020.3023871","volume":"8","author":"Y Cimtay","year":"2020","unstructured":"Cimtay Y, Ekmekcioglu E, Caglar-Ozhan S (2020) Cross-subject multimodal emotion recognition based on hybrid fusion. IEEE Access 8:168865\u2013168878","journal-title":"IEEE Access"},{"issue":"10","key":"5598_CR15","doi-asserted-by":"publisher","first-page":"4905","DOI":"10.1109\/TNNLS.2017.2776248","volume":"29","author":"M Alam","year":"2018","unstructured":"Alam M, Vidyaratne LS, Iftekharuddin KM (2018) Sparse simultaneous recurrent deep learning for robust facial expression recognition. IEEE Trans Neural Netw Learn Syst 29(10):4905\u20134916","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"issue":"24","key":"5598_CR16","doi-asserted-by":"publisher","first-page":"30219","DOI":"10.1007\/s10489-023-05052-y","volume":"53","author":"Verma B Nidhi","year":"2023","unstructured":"Nidhi Verma B (2023) From methods to datasets: a detailed study on facial emotion recognition. Appl Intell 53(24):30219\u201330249","journal-title":"Appl Intell"},{"key":"5598_CR17","doi-asserted-by":"publisher","first-page":"69311","DOI":"10.1109\/ACCESS.2020.2986654","volume":"8","author":"SK Jarraya","year":"2020","unstructured":"Jarraya SK, Masmoudi M, Hammami M (2020) Compound emotion recognition of autistic children during meltdown crisis based on deep spatio-temporal analysis of facial geometric features. IEEE Access 8:69311\u201369326","journal-title":"IEEE Access"},{"key":"5598_CR18","doi-asserted-by":"crossref","unstructured":"Guo J, Zhou S, Wu J, Wan J, Zhu X, Lei Z, Li SZ (2017) Multi-modality network with visual and geometrical information for micro emotion recognition. In: 2017 12th IEEE international conference on automatic face & gesture recognition (FG 2017), pp 814\u2013819. IEEE","DOI":"10.1109\/FG.2017.103"},{"key":"5598_CR19","doi-asserted-by":"crossref","unstructured":"Li S, Deng W, Du J (2017) Reliable crowdsourcing and deep locality-preserving learning for expression recognition in the wild. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2852\u20132861","DOI":"10.1109\/CVPR.2017.277"},{"issue":"22","key":"5598_CR20","doi-asserted-by":"publisher","first-page":"2847","DOI":"10.3390\/electronics10222847","volume":"10","author":"D Kami\u0144ska","year":"2021","unstructured":"Kami\u0144ska D, Aktas K, Rizhinashvili D, Kuklyanov D, Sham AH, Escalera S, Nasrollahi K, Moeslund TB, Anbarjafari G (2021) Two-stage recognition and beyond for compound facial emotion recognition. Electronics 10(22):2847","journal-title":"Electronics"},{"key":"5598_CR21","doi-asserted-by":"crossref","unstructured":"Shaila S, Shivamma D, Monica U, Tejashree K (2022) Facial expression recognition for compound emotions using mobile net architecture. In: 2022 International conference on artificial intelligence and data engineering (AIDE), pp 187\u2013190. IEEE","DOI":"10.1109\/AIDE57180.2022.10060734"},{"key":"5598_CR22","doi-asserted-by":"publisher","first-page":"482","DOI":"10.1109\/TIFS.2020.3007327","volume":"16","author":"L Liang","year":"2020","unstructured":"Liang L, Lang C, Li Y, Feng S, Zhao J (2020) Fine-grained facial expression recognition in the wild. IEEE Trans Inf Forensic Secur 16:482\u2013494","journal-title":"IEEE Trans Inf Forensic Secur"},{"issue":"6","key":"5598_CR23","doi-asserted-by":"publisher","first-page":"4764","DOI":"10.1109\/TCYB.2020.3036935","volume":"52","author":"G Pons","year":"2020","unstructured":"Pons G, Masip D (2020) Multitask, multilabel, and multidomain learning with convolutional networks for emotion recognition. IEEE Trans Cybern 52(6):4764\u20134771","journal-title":"IEEE Trans Cybern"},{"key":"5598_CR24","doi-asserted-by":"crossref","unstructured":"Kirillov A, Mintun E, Ravi N, Mao H, Rolland C, Gustafson L, Xiao T, Whitehead S, Berg AC, Lo W-Y et al (2023) Segment anything. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 4015\u20134026","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"5598_CR25","unstructured":"Dosovitskiy A, Beyer L, Kolesnikov A, Weissenborn D, Zhai X, Unterthiner T, Dehghani M, Minderer M, Heigold G, Gelly S, Uszkoreit J, Houlsby N (2021) An image is worth 16x16 words: Transformers for image recognition at scale. In: International conference on learning representations. https:\/\/openreview.net\/forum?id=YicbFdNTTy"},{"key":"5598_CR26","unstructured":"Ma F, Sun B, Li S (2021) Facial expression recognition with visual transformers and attentional selective fusion. IEEE Transactions on Affective Computing"},{"key":"5598_CR27","doi-asserted-by":"publisher","first-page":"102367","DOI":"10.1016\/j.inffus.2024.102367","volume":"108","author":"Z Lian","year":"2024","unstructured":"Lian Z, Sun L, Sun H, Chen K, Wen Z, Gu H, Liu B, Tao J (2024) Gpt-4v with emotion: A zero-shot benchmark for generalized emotion recognition. Inf Fusion 108:102367","journal-title":"Inf Fusion"},{"issue":"1","key":"5598_CR28","doi-asserted-by":"publisher","first-page":"46","DOI":"10.5281\/zenodo.11083875","volume":"1","author":"A Zhu","year":"2024","unstructured":"Zhu A, Li K, Wu T, Zhao P, Hong B (2024) Cross-task multi-branch vision transformer for facial expression and mask wearing classification. J Comput Technol Appl Math 1(1):46\u201353. https:\/\/doi.org\/10.5281\/zenodo.11083875","journal-title":"J Comput Technol Appl Math"},{"key":"5598_CR29","doi-asserted-by":"crossref","unstructured":"Dong R, Lam K-M (2024) Bi-center loss for compound facial expression recognition. IEEE Signal Processing Letters","DOI":"10.1109\/LSP.2024.3364055"},{"key":"5598_CR30","doi-asserted-by":"crossref","unstructured":"Xue F, Wang Q, Guo G (2021) Transfer: Learning relation-aware facial expression representations with transformers. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 3601\u20133610","DOI":"10.1109\/ICCV48922.2021.00358"},{"key":"5598_CR31","doi-asserted-by":"publisher","unstructured":"Zhao X, Lv Y, Huang Z (2022) Multimodal fusion-based swin transformer for facial recognition micro-expression recognition. In: 2022 IEEE international conference on mechatronics and automation (ICMA), pp 780\u2013785. https:\/\/doi.org\/10.1109\/ICMA54519.2022.9856162","DOI":"10.1109\/ICMA54519.2022.9856162"},{"key":"5598_CR32","doi-asserted-by":"crossref","unstructured":"Xue F, Tan Z, Zhu Y, Ma Z, Guo G (2022) Coarse-to-fine cascaded networks with smooth predicting for video facial expression recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 2412\u20132418","DOI":"10.1109\/CVPRW56347.2022.00269"},{"key":"5598_CR33","unstructured":"DeVries T, Taylor GW (2017) Improved regularization of convolutional neural networks with cutout. arXiv preprint arXiv:1708.04552"},{"key":"5598_CR34","unstructured":"Zhang H, Cisse M, Dauphin YN, Lopez-Paz D (2018) mixup: Beyond empirical risk minimization. In: International conference on learning representations, pp 1\u201313"},{"key":"5598_CR35","doi-asserted-by":"crossref","unstructured":"Yun S, Han D, Oh SJ, Chun S, Choe J, Yoo Y (2019) Cutmix: Regularization strategy to train strong classifiers with localizable features. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 6023\u20136032","DOI":"10.1109\/ICCV.2019.00612"},{"key":"5598_CR36","doi-asserted-by":"publisher","first-page":"110173","DOI":"10.1016\/j.patcog.2023.110173","volume":"148","author":"J Jiang","year":"2024","unstructured":"Jiang J, Wang M, Xiao B, Hu J, Deng W (2024) Joint recognition of basic and compound facial expressions by mining latent soft labels. Pattern Recognit 148:110173","journal-title":"Pattern Recognit"},{"key":"5598_CR37","doi-asserted-by":"crossref","unstructured":"Szegedy C, Vanhoucke V, Ioffe S, Shlens J, Wojna Z (2016) Rethinking the inception architecture for computer vision. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2818\u20132826","DOI":"10.1109\/CVPR.2016.308"},{"key":"5598_CR38","doi-asserted-by":"crossref","unstructured":"Kim K, Ji B, Yoon D, Hwang S (2021) Self-knowledge distillation with progressive refinement of targets. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 6567\u20136576","DOI":"10.1109\/ICCV48922.2021.00650"},{"key":"5598_CR39","doi-asserted-by":"crossref","unstructured":"He K, Chen X, Xie S, Li Y, Doll\u00e1r P, Girshick R (2022) Masked autoencoders are scalable vision learners. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 16000\u201316009","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"5598_CR40","first-page":"3965","volume":"34","author":"Z Dai","year":"2021","unstructured":"Dai Z, Liu H, Le QV, Tan M (2021) Coatnet: Marrying convolution and attention for all data sizes. Adv Neural Inf Process Syst 34:3965\u20133977","journal-title":"Adv Neural Inf Process Syst"},{"issue":"3","key":"5598_CR41","doi-asserted-by":"publisher","first-page":"1143","DOI":"10.1109\/TCDS.2021.3100131","volume":"14","author":"Y Xia","year":"2021","unstructured":"Xia Y, Yu H, Wang X, Jian M, Wang F-Y (2021) Relation-aware facial expression recognition. IEEE Trans Cognit Dev Syst 14(3):1143\u20131154","journal-title":"IEEE Trans Cognit Dev Syst"},{"key":"5598_CR42","doi-asserted-by":"publisher","first-page":"131988","DOI":"10.1109\/ACCESS.2020.3010018","volume":"8","author":"T-H Vo","year":"2020","unstructured":"Vo T-H, Lee G-S, Yang H-J, Kim S-H (2020) Pyramid with super resolution for in-the-wild facial expression recognition. IEEE Access 8:131988\u2013132001","journal-title":"IEEE Access"},{"key":"5598_CR43","doi-asserted-by":"crossref","unstructured":"Kollias D (2023) Multi-label compound expression recognition: C-expr database & network. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 5589\u20135598","DOI":"10.1109\/CVPR52729.2023.00541"},{"key":"5598_CR44","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"5598_CR45","unstructured":"Yu J, Wang Z, Vasudevan V, Yeung L, Seyedhosseini M, Wu Y (2022) Coca: Contrastive captioners are image-text foundation models. Trans Mach Learn Res 2022"},{"key":"5598_CR46","doi-asserted-by":"crossref","unstructured":"Srivastava S, Sharma G (2024) Omnivec: Learning robust representations with cross modal sharing. In: Proceedings of the IEEE\/CVF winter conference on applications of computer vision, pp 1236\u20131248","DOI":"10.1109\/WACV57701.2024.00127"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-024-05598-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-024-05598-5\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-024-05598-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,21]],"date-time":"2024-11-21T21:01:15Z","timestamp":1732222875000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-024-05598-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,6,14]]},"references-count":46,"journal-issue":{"issue":"17-18","published-print":{"date-parts":[[2024,9]]}},"alternative-id":["5598"],"URL":"https:\/\/doi.org\/10.1007\/s10489-024-05598-5","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"value":"0924-669X","type":"print"},{"value":"1573-7497","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,6,14]]},"assertion":[{"value":"6 June 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 June 2024","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"On behalf of all the authors, the corresponding author declares that there is no competing financial interest to influence the work presented in this paper.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing of interest"}}]}}