{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T15:05:48Z","timestamp":1778079948041,"version":"3.51.4"},"reference-count":42,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2023,6,14]],"date-time":"2023-06-14T00:00:00Z","timestamp":1686700800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,6,14]],"date-time":"2023-06-14T00:00:00Z","timestamp":1686700800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["grant 62236006"],"award-info":[{"award-number":["grant 62236006"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100015401","name":"Key Research and Development Projects of Shaanxi Province","doi-asserted-by":"publisher","award":["No. 2022ZDLGY06-03"],"award-info":[{"award-number":["No. 2022ZDLGY06-03"]}],"id":[{"id":"10.13039\/501100015401","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2023,10]]},"DOI":"10.1007\/s00530-023-01122-w","type":"journal-article","created":{"date-parts":[[2023,6,14]],"date-time":"2023-06-14T02:01:50Z","timestamp":1686708110000},"page":"2715-2728","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":7,"title":["Cross-view adaptive graph attention network for dynamic facial expression recognition"],"prefix":"10.1007","volume":"29","author":[{"given":"Yan","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Min","family":"Xi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dongmei","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,6,14]]},"reference":[{"key":"1122_CR1","doi-asserted-by":"crossref","unstructured":"Rajagopalan, S.S., Morency, L.-P., Baltrusaitis, T., Goecke, R.: Extending long short-term memory for multi-view structured learning. In: European Conference on Computer Vision, pp. 338\u2013 353. Springer (2016)","DOI":"10.1007\/978-3-319-46478-7_21"},{"key":"1122_CR2","volume-title":"What the Face Reveals: Basic and Applied Studies of Spontaneous Expression Using the Facial Action Coding System (FACS)","author":"R Ekman","year":"1997","unstructured":"Ekman, R.: What the Face Reveals: Basic and Applied Studies of Spontaneous Expression Using the Facial Action Coding System (FACS). Oxford University Press, Oxford (1997)"},{"key":"1122_CR3","doi-asserted-by":"publisher","unstructured":"Parkhi, O.M., Vedaldi, A., Zisserman, A.: Deep face recognition. Xie, X., Jones, M.W., Tam, G.K.L. (eds) Proceedings of the British Machine Vision Conference (BMVC). BMVA Press (2015). https:\/\/doi.org\/10.5244\/C.29.41","DOI":"10.5244\/C.29.41"},{"key":"1122_CR4","doi-asserted-by":"crossref","unstructured":"Sun, B., Wei, Q., Li, L., Xu, Q., He, J., Yu, L.: Lstm for dynamic emotion and group emotion recognition in the wild. In: Proceedings of the 18th ACM International Conference on Multimodal Interaction, pp. 451\u2013 457 (2016)","DOI":"10.1145\/2993148.2997640"},{"key":"1122_CR5","doi-asserted-by":"publisher","first-page":"27","DOI":"10.1016\/j.neucom.2018.03.068","volume":"309","author":"J Yan","year":"2018","unstructured":"Yan, J., Zheng, W., Cui, Z., Tang, C., Zhang, T., Zong, Y.: Multi-cue fusion for emotion recognition in the wild. Neurocomputing 309, 27\u201335 (2018)","journal-title":"Neurocomputing"},{"key":"1122_CR6","doi-asserted-by":"publisher","first-page":"48807","DOI":"10.1109\/ACCESS.2019.2907271","volume":"7","author":"X Pan","year":"2019","unstructured":"Pan, X., Ying, G., Chen, G., Li, H., Li, W.: A deep spatial and temporal aggregation framework for video-based facial expression recognition. IEEE Access 7, 48807\u201348815 (2019)","journal-title":"IEEE Access"},{"issue":"10","key":"1122_CR7","doi-asserted-by":"publisher","first-page":"3030","DOI":"10.1109\/TCSVT.2017.2719043","volume":"28","author":"S Zhang","year":"2017","unstructured":"Zhang, S., Zhang, S., Huang, T., Gao, W., Tian, Q.: Learning affective features with a hybrid deep model for audio-visual emotion recognition. IEEE Trans. Circuits Syst. Video Technol. 28(10), 3030\u20133043 (2017)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"1122_CR8","doi-asserted-by":"publisher","first-page":"184","DOI":"10.1016\/j.inffus.2018.06.003","volume":"46","author":"Y Ma","year":"2019","unstructured":"Ma, Y., Hao, Y., Chen, M., Chen, J., Lu, P., Ko\u0161ir, A.: Audio-visual emotion fusion (avef): a deep efficient weighted approach. Inf. Fusion 46, 184\u2013192 (2019)","journal-title":"Inf. Fusion"},{"key":"1122_CR9","doi-asserted-by":"crossref","unstructured":"Zhao, Z., Liu, Q.: Former-dfer: dynamic facial expression recognition transformer. In: Proceedings of the 29th ACM International Conference on Multimedia, pp. 1553\u2013 1561 (2021)","DOI":"10.1145\/3474085.3475292"},{"key":"1122_CR10","unstructured":"Liu, Y., Wang, W., Feng, C., Zhang, H., Chen, Z., Zhan, Y.: Expression snippet transformer for robust video-based facial expression recognition. arXiv preprint arXiv:2109.08409 (2021)"},{"key":"1122_CR11","doi-asserted-by":"crossref","unstructured":"Shirian, A., Tripathi, S., Guha, T.: Dynamic emotion modeling with learnable graphs and graph inception network. IEEE Trans. Multimed. 24, 780\u2013790 (2021)","DOI":"10.1109\/TMM.2021.3059169"},{"key":"1122_CR12","doi-asserted-by":"publisher","first-page":"32297","DOI":"10.1109\/ACCESS.2019.2901521","volume":"7","author":"S Zhang","year":"2019","unstructured":"Zhang, S., Pan, X., Cui, Y., Zhao, X., Liu, L.: Learning affective video features for facial expression recognition via hybrid deep learning. IEEE Access 7, 32297\u201332304 (2019)","journal-title":"IEEE Access"},{"key":"1122_CR13","doi-asserted-by":"crossref","unstructured":"Wang, Y., Wu, J., Hoashi, K.: Multi-attention fusion network for video-based emotion recognition. In: 2019 International Conference on Multimodal Interaction, pp. 595\u2013 601 (2019)","DOI":"10.1145\/3340555.3355720"},{"key":"1122_CR14","doi-asserted-by":"crossref","unstructured":"Liu, C., Tang, T., Lv, K., Wang, M.: Multi-feature based emotion recognition for video clips. In: Proceedings of the 20th ACM International Conference on Multimodal Interaction, pp. 630\u2013 634 (2018)","DOI":"10.1145\/3242969.3264989"},{"key":"1122_CR15","doi-asserted-by":"crossref","unstructured":"Fan, Y., Lam, J.C., Li, V.O.: Video-based emotion recognition using deeply-supervised neural networks. In: Proceedings of the 20th ACM International Conference on Multimodal Interaction, pp. 584\u2013 588 (2018)","DOI":"10.1145\/3242969.3264978"},{"key":"1122_CR16","doi-asserted-by":"crossref","unstructured":"Fan, Y., Lu, X., Li, D., Liu, Y.: Video-based emotion recognition using cnn-rnn and c3d hybrid networks. In: Proceedings of the 18th ACM International Conference on Multimodal Interaction, pp. 445\u2013 450 (2016)","DOI":"10.1145\/2993148.2997632"},{"key":"1122_CR17","doi-asserted-by":"crossref","unstructured":"Ayral, T., Pedersoli, M., Bacon, S., Granger, E.: Temporal stochastic softmax for 3d cnns: an application in facial expression recognition. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 3029\u2013 3038 (2021)","DOI":"10.1109\/WACV48630.2021.00307"},{"key":"1122_CR18","doi-asserted-by":"publisher","first-page":"182","DOI":"10.1016\/j.ins.2022.03.062","volume":"598","author":"Y Liu","year":"2022","unstructured":"Liu, Y., Feng, C., Yuan, X., Zhou, L., Wang, W., Qin, J., Luo, Z.: Clip-aware expressive feature learning for video-based facial expression recognition. Inf. Sci. 598, 182\u2013195 (2022)","journal-title":"Inf. Sci."},{"issue":"2","key":"1122_CR19","doi-asserted-by":"publisher","first-page":"479","DOI":"10.1007\/s00530-021-00849-8","volume":"28","author":"X Xia","year":"2022","unstructured":"Xia, X., Yang, L., Wei, X., Sahli, H., Jiang, D.: A multi-scale multi-attention network for dynamic facial expression recognition. Multimed. Syst. 28(2), 479\u2013493 (2022)","journal-title":"Multimed. Syst."},{"key":"1122_CR20","doi-asserted-by":"crossref","unstructured":"Ghaleb, E., Popa, M., Asteriadis, S.: Multimodal and temporal perception of audio-visual cues for emotion recognition. In: 2019 8th International Conference on Affective Computing and Intelligent Interaction (ACII), pp. 552\u2013 558. IEEE (2019)","DOI":"10.1109\/ACII.2019.8925444"},{"key":"1122_CR21","doi-asserted-by":"publisher","first-page":"2617","DOI":"10.1109\/TASLP.2021.3096037","volume":"29","author":"H Zhou","year":"2021","unstructured":"Zhou, H., Du, J., Zhang, Y., Wang, Q., Liu, Q.-F., Lee, C.-H.: Information fusion in attention networks using adaptive and multi-level factorized bilinear pooling for audio-visual emotion recognition. IEEE\/ACM Trans. Audio Speech Lang. Process. 29, 2617\u20132629 (2021)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"1122_CR22","unstructured":"Veli\u010dkovi\u0107, P., Cucurull, G., Casanova, A., Romero, A., Li\u00f2, P., Bengio, Y.: Graph attention networks. In: International Conference on Learning Representations (2018)"},{"key":"1122_CR23","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141., Polosukhin, I.: Attention is all you need. In: Advances in Neural Information Processing Systems, pp. 5998\u2013 6008 (2017)"},{"key":"1122_CR24","doi-asserted-by":"crossref","unstructured":"Hu, J., Shen, L., Sun, G.: Squeeze-and-excitation networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 7132\u2013 7141 (2018)","DOI":"10.1109\/CVPR.2018.00745"},{"key":"1122_CR25","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013 778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"1122_CR26","first-page":"3","volume":"30","author":"AL Maas","year":"2013","unstructured":"Maas, A.L., Hannun, A.Y., Ng, A.Y.: Rectifier nonlinearities improve neural network acoustic models. Proc. Icml 30, 3 (2013). (Citeseer)","journal-title":"Proc. Icml"},{"issue":"5","key":"1122_CR27","doi-asserted-by":"publisher","first-page":"936","DOI":"10.1109\/TMM.2008.927665","volume":"10","author":"Y Wang","year":"2008","unstructured":"Wang, Y., Guan, L.: Recognizing human emotional state from audiovisual signals. IEEE Trans. Multimed. 10(5), 936\u2013946 (2008)","journal-title":"IEEE Trans. Multimed."},{"issue":"03","key":"1122_CR28","doi-asserted-by":"publisher","first-page":"34","DOI":"10.1109\/MMUL.2012.26","volume":"19","author":"A Dhall","year":"2012","unstructured":"Dhall, A., Goecke, R., Lucey, S., Gedeon, T.: Collecting large, richly annotated facial-expression databases from movies. IEEE Multimed. 19(03), 34\u201341 (2012)","journal-title":"IEEE Multimed."},{"key":"1122_CR29","doi-asserted-by":"crossref","unstructured":"Dhall, A.: Emotiw 2019: automatic emotion, engagement and cohesion prediction tasks. In: 2019 International Conference on Multimodal Interaction, pp. 546\u2013 550 (2019)","DOI":"10.1145\/3340555.3355710"},{"key":"1122_CR30","doi-asserted-by":"crossref","unstructured":"Baltrusaitis, T., Zadeh, A., Lim, Y.C., Morency, L.-P.: Openface 2.0: Facial behavior analysis toolkit. In: 2018 13th IEEE International Conference on Automatic Face & Gesture Recognition (FG 2018), pp. 59\u2013 66. IEEE (2018)","DOI":"10.1109\/FG.2018.00019"},{"key":"1122_CR31","doi-asserted-by":"crossref","unstructured":"Deng, J., Guo, J., Niannan, X., Zafeiriou, S.: Arcface: Additive angular margin loss for deep face recognition. In: CVPR ( 2019)","DOI":"10.1109\/CVPR.2019.00482"},{"key":"1122_CR32","unstructured":"Glorot, X., Bengio, Y.: Understanding the difficulty of training deep feedforward neural networks. In: Proceedings of the Thirteenth International Conference on Artificial Intelligence and Statistics. JMLR Workshop and Conference Proceedings, pp. 249\u2013 256 (2010)"},{"key":"1122_CR33","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. In: ICLR (Poster) ( 2015)"},{"key":"1122_CR34","unstructured":"Paszke, A., Gross, S., Massa, F., Lerer, A., Bradbury, J., Chanan, G., Killeen, T., Lin, Z., Gimelshein, N., Antiga, L., et al.: Pytorch: an imperative style, high-performance deep learning library. In: Advances in Neural Information Processing Systems, pp. 8026\u2013 8037 (2019)"},{"issue":"5\u20136","key":"1122_CR35","doi-asserted-by":"publisher","first-page":"602","DOI":"10.1016\/j.neunet.2005.06.042","volume":"18","author":"A Graves","year":"2005","unstructured":"Graves, A., Schmidhuber, J.: Framewise phoneme classification with bidirectional lstm and other neural network architectures. Neural Netw. 18(5\u20136), 602\u2013610 (2005)","journal-title":"Neural Netw."},{"key":"1122_CR36","doi-asserted-by":"crossref","unstructured":"Zhang, S., Zhang, S., Huang, T., Gao, W.: Multimodal deep convolutional neural network for audio-visual emotion recognition. In: Proceedings of the 2016 ACM on International Conference on Multimedia Retrieval, pp. 281\u2013 284 ( 2016)","DOI":"10.1145\/2911996.2912051"},{"key":"1122_CR37","doi-asserted-by":"crossref","unstructured":"Kansizoglou, I., Bampis, L., Gasteratos, A.: An active learning paradigm for online audio-visual emotion recognition. IEEE Trans. Affect. Comput. 13, 756\u2013768 (2019)","DOI":"10.1109\/TAFFC.2019.2961089"},{"key":"1122_CR38","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: Advances in Neural Information Processing Systems, vol. 25 (2012)"},{"key":"1122_CR39","doi-asserted-by":"crossref","unstructured":"Zhao, X., Chen, G., Chuang, Y., Tao, X., Zhang, S.: Learning expression features via deep residual attention networks for facial expression recognition from video sequences. IETE Tech. Rev. 38, 1\u20139 (2020)","DOI":"10.1080\/02564602.2020.1814168"},{"key":"1122_CR40","doi-asserted-by":"crossref","unstructured":"Vielzeuf, V., Kervadec, C., Pateux, S., Lechervy, A., Jurie, F.: An occam\u2019s razor view on learning audiovisual emotion recognition with small training sets. In: Proceedings of the 20th ACM International Conference on Multimodal Interaction, pp. 589\u2013 593 (2018)","DOI":"10.1145\/3242969.3264980"},{"key":"1122_CR41","doi-asserted-by":"crossref","unstructured":"Knyazev, B., Shvetsov, R., Efremova, N., Kuharenko, A.: Leveraging large face recognition data for emotion classification. In: 2018 13th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2018), pp. 692\u2013 696 (2018). IEEE","DOI":"10.1109\/FG.2018.00109"},{"key":"1122_CR42","doi-asserted-by":"crossref","unstructured":"Li, S., Zheng, W., Zong, Y., Lu, C., Tang, C., Jiang, X., Liu, J., Xia, W.: Bi-modality fusion for emotion recognition in the wild. In: 2019 International Conference on Multimodal Interaction, pp. 589\u2013 594 (2019)","DOI":"10.1145\/3340555.3355719"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-023-01122-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-023-01122-w\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-023-01122-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,9,15]],"date-time":"2023-09-15T13:08:38Z","timestamp":1694783318000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-023-01122-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,6,14]]},"references-count":42,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2023,10]]}},"alternative-id":["1122"],"URL":"https:\/\/doi.org\/10.1007\/s00530-023-01122-w","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,6,14]]},"assertion":[{"value":"6 December 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 May 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 June 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}