{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,25]],"date-time":"2025-03-25T14:11:47Z","timestamp":1742911907704,"version":"3.40.3"},"publisher-location":"Singapore","reference-count":41,"publisher":"Springer Nature Singapore","isbn-type":[{"type":"print","value":"9789819611508"},{"type":"electronic","value":"9789819611515"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-96-1151-5_4","type":"book-chapter","created":{"date-parts":[[2025,2,6]],"date-time":"2025-02-06T16:01:55Z","timestamp":1738857715000},"page":"31-40","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Content-Aware Efficient Learner for\u00a0Audio-Visual Emotion Recognition"],"prefix":"10.1007","author":[{"given":"Guanjie","family":"Huang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Weilin","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Li","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,2,7]]},"reference":[{"key":"4_CR1","unstructured":"Baevski, A., Zhou, Y., et\u00a0al.: wav2vec 2.0: a framework for self-supervised learning of speech representations (2020)"},{"issue":"4","key":"4_CR2","doi-asserted-by":"publisher","first-page":"377","DOI":"10.1109\/TAFFC.2014.2336244","volume":"5","author":"H Cao","year":"2014","unstructured":"Cao, H., Cooper, D.G., et al.: CREMA-D: crowd-sourced emotional multimodal actors dataset. IEEE Trans. Affect. Comput. 5(4), 377\u2013390 (2014)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"4_CR3","doi-asserted-by":"crossref","unstructured":"Cao, Q., Shen, L., et\u00a0al.: VggFace2: a dataset for recognising faces across pose and age. In: FG 2018 (2018)","DOI":"10.1109\/FG.2018.00020"},{"issue":"6","key":"4_CR4","doi-asserted-by":"publisher","first-page":"1505","DOI":"10.1109\/JSTSP.2022.3188113","volume":"16","author":"S Chen","year":"2022","unstructured":"Chen, S., Wang, C., et al.: WavLM: large-scale self-supervised pre-training for full stack speech processing. IEEE J. Sel. Top. Signal Process. 16(6), 1505\u20131518 (2022)","journal-title":"IEEE J. Sel. Top. Signal Process."},{"key":"4_CR5","doi-asserted-by":"crossref","unstructured":"Chen, S., Jin, Q., et\u00a0al.: Multimodal multi-task learning for dimensional and continuous emotion recognition. In: Proceedings of the 7th Annual Workshop on Audio\/Visual Emotion Challenge (2017)","DOI":"10.1145\/3133944.3133949"},{"key":"4_CR6","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"627","DOI":"10.1007\/978-3-030-87237-3_60","volume-title":"Medical Image Computing and Computer Assisted Intervention \u2013 MICCAI 2021","author":"Y Chen","year":"2021","unstructured":"Chen, Y., et al.: USCL: pretraining deep ultrasound image diagnosis model through video contrastive representation learning. In: de Bruijne, M., et al. (eds.) MICCAI 2021, Part VIII. LNCS, vol. 12908, pp. 627\u2013637. Springer, Cham (2021). https:\/\/doi.org\/10.1007\/978-3-030-87237-3_60"},{"key":"4_CR7","doi-asserted-by":"crossref","unstructured":"Chung, J.S., Nagrani, A., Zisserman, A.: Voxceleb2: deep speaker recognition. arXiv (2018)","DOI":"10.21437\/Interspeech.2018-1929"},{"key":"4_CR8","unstructured":"Dalal, N., Triggs, B.: Histograms of oriented gradients for human detection. In: CVPR (2005)"},{"key":"4_CR9","unstructured":"Dosovitskiy, A., Beyer, L., et\u00a0al.: An image is worth 16$$\\times $$16 words: transformers for image recognitfion at scale. In: ICLR (2020)"},{"issue":"2","key":"4_CR10","doi-asserted-by":"publisher","first-page":"190","DOI":"10.1109\/TAFFC.2015.2457417","volume":"7","author":"F Eyben","year":"2015","unstructured":"Eyben, F., Scherer, K.R., et al.: The Geneva minimalistic acoustic parameter set (GeMAPS) for voice research and affective computing. IEEE Trans. Affect. Comput. 7(2), 190\u2013202 (2015)","journal-title":"IEEE Trans. Affect. Comput."},{"key":"4_CR11","doi-asserted-by":"crossref","unstructured":"Fan, R., Liu, H., et\u00a0al.: AttA-NET: attention aggregation network for audio-visual emotion recognition. In: ICASSP (2024)","DOI":"10.1109\/ICASSP48485.2024.10447640"},{"key":"4_CR12","doi-asserted-by":"crossref","unstructured":"Hershey, S., Chaudhuri, S., et\u00a0al.: CNN architectures for large-scale audio classification. In: ICASSP (2017)","DOI":"10.1109\/ICASSP.2017.7952132"},{"key":"4_CR13","unstructured":"Houlsby, N., Giurgiu, A., et\u00a0al.: Parameter-efficient transfer learning for NLP. In: ICML (2019)"},{"key":"4_CR14","first-page":"3451","volume":"29","author":"WN Hsu","year":"2021","unstructured":"Hsu, W.N., Bolte, B., et al.: HuBERT: self-supervised speech representation learning by masked prediction of hidden units. TASLP 29, 3451\u20133460 (2021)","journal-title":"TASLP"},{"key":"4_CR15","doi-asserted-by":"crossref","unstructured":"Hu, T., Xu, A., et\u00a0al.: Touch your heart: a tone-aware chatbot for customer care on social media. In: Proceedings of the 2018 CHI Conference on Human Factors in Computing Systems (2018)","DOI":"10.1145\/3173574.3173989"},{"key":"4_CR16","unstructured":"Jie, S., Deng, Z.H.: Convolutional bypasses are better vision transformer adapters. arXiv (2022)"},{"key":"4_CR17","doi-asserted-by":"publisher","first-page":"2880","DOI":"10.1109\/TASLP.2020.3030497","volume":"28","author":"Q Kong","year":"2020","unstructured":"Kong, Q., Cao, Y., et al.: PANNs: large-scale pretrained audio neural networks for audio pattern recognition. IEEE\/ACM Trans. Audio Speech Lang. Process. 28, 2880\u20132894 (2020)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"4_CR18","doi-asserted-by":"publisher","first-page":"292","DOI":"10.1109\/TMM.2020.2976493","volume":"23","author":"L Liu","year":"2020","unstructured":"Liu, L., Feng, G., Beautemps, D., Zhang, X.P.: Re-synchronization using the hand preceding model for multi-modal fusion in automatic continuous cued speech recognition. IEEE Trans. Multimed. 23, 292\u2013305 (2020)","journal-title":"IEEE Trans. Multimed."},{"key":"4_CR19","doi-asserted-by":"crossref","unstructured":"Liu, L., Hueber, T., Feng, G., Beautemps, D.: Visual recognition of continuous cued speech using a tandem CNN-HMM approach. In: Interspeech, pp. 2643\u20132647 (2018)","DOI":"10.21437\/Interspeech.2018-2434"},{"key":"4_CR20","doi-asserted-by":"crossref","unstructured":"Meng, L., Liu, Y., et\u00a0al.: Valence and arousal estimation based on multimodal temporal-aware features for videos in the wild. In: CVPR (2022)","DOI":"10.1109\/CVPRW56347.2022.00261"},{"key":"4_CR21","doi-asserted-by":"publisher","first-page":"114382","DOI":"10.1016\/j.eswa.2020.114382","volume":"170","author":"M Polignano","year":"2021","unstructured":"Polignano, M., Narducci, F., et al.: Towards emotion-aware recommender systems: an affective coherence model based on emotion-driven behaviors. Expert Syst. Appl. 170, 114382 (2021)","journal-title":"Expert Syst. Appl."},{"key":"4_CR22","unstructured":"Radford, A., Kim, J.W., et\u00a0al.: Learning transferable visual models from natural language supervision. In: ICML (2021)"},{"key":"4_CR23","doi-asserted-by":"crossref","unstructured":"Sadok, S., Leglaive, S., S\u00e9guier, R.: A vector quantized masked autoencoder for audiovisual speech emotion recognition. arXiv (2023)","DOI":"10.1109\/ICASSPW59220.2023.10193151"},{"key":"4_CR24","doi-asserted-by":"crossref","unstructured":"Schuller, B., Steidl, S., et\u00a0al.: The interspeech 2013 computational paralinguistics challenge: social signals, conflict, emotion, autism. In: INTERSPEECH (2013)","DOI":"10.21437\/Interspeech.2013-56"},{"key":"4_CR25","doi-asserted-by":"crossref","unstructured":"Sun, L., Lian, Z., et\u00a0al.: Multi-modal continuous dimensional emotion recognition using recurrent neural network and self-attention mechanism. In: Proceedings of the 1st International on Multimodal Sentiment Analysis in Real-Life Media Challenge and Workshop (2020)","DOI":"10.1145\/3423327.3423672"},{"key":"4_CR26","doi-asserted-by":"crossref","unstructured":"Sun, L., Lian, Z., et\u00a0al.: Efficient multimodal transformer with dual-level feature restoration for robust multimodal sentiment analysis (2023)","DOI":"10.1109\/TAFFC.2023.3274829"},{"key":"4_CR27","doi-asserted-by":"crossref","unstructured":"Sun, L., Lian, Z., et\u00a0al.: MAE-DFER: efficient masked autoencoder for self-supervised dynamic facial expression recognition. In: ACM Multimedia (2023)","DOI":"10.1145\/3581783.3612365"},{"key":"4_CR28","doi-asserted-by":"crossref","unstructured":"Sun, L., Lian, Z., et\u00a0al.: SVFAP: self-supervised video facial affect perceiver. arXiv (2023)","DOI":"10.1109\/TAFFC.2024.3436913"},{"key":"4_CR29","doi-asserted-by":"crossref","unstructured":"Sun, L., Lian, Z., et\u00a0al.: HiCMAE: hierarchical contrastive masked autoencoder for self-supervised audio-visual emotion recognition. arXiv (2024)","DOI":"10.1016\/j.inffus.2024.102382"},{"key":"4_CR30","doi-asserted-by":"crossref","unstructured":"Sun, L., Xu, M., et\u00a0al.: Multimodal emotion recognition and sentiment analysis via attention enhanced recurrent model. In: MSAC (2021)","DOI":"10.1145\/3475957.3484456"},{"key":"4_CR31","unstructured":"Touvron, H., Martin, L., et\u00a0al.: Llama 2: open foundation and fine-tuned chat models. arXiv (2023)"},{"key":"4_CR32","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., et\u00a0al.: Learning spatiotemporal features with 3D convolutional networks. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.510"},{"key":"4_CR33","doi-asserted-by":"crossref","unstructured":"Tsai, Y.H.H., Bai, S., et\u00a0al.: Multimodal transformer for unaligned multimodal language sequences. In: ACL (2019)","DOI":"10.18653\/v1\/P19-1656"},{"key":"4_CR34","unstructured":"Vaswani, A., Shazeer, N., et\u00a0al.: Attention is all you need. In: NeurIPS (2017)"},{"key":"4_CR35","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1016\/j.patrec.2022.07.012","volume":"161","author":"S Verbitskiy","year":"2022","unstructured":"Verbitskiy, S., Berikov, V., Vyshegorodtsev, V.: ERANNs: efficient residual audio neural networks for audio pattern recognition. Pattern Recogn. Lett. 161, 38\u201344 (2022)","journal-title":"Pattern Recogn. Lett."},{"key":"4_CR36","doi-asserted-by":"crossref","unstructured":"Wang, J., Zhao, Y., Liu, L., Xu, T., Li, Q., Li, S.: Emotional talking head generation based on memory-sharing and attention-augmented networks (2023)","DOI":"10.21437\/Interspeech.2023-749"},{"key":"4_CR37","doi-asserted-by":"publisher","first-page":"e12","DOI":"10.1017\/ATSIP.2014.11","volume":"3","author":"CH Wu","year":"2014","unstructured":"Wu, C.H., Lin, J.C., Wei, W.L.: Survey on audiovisual emotion recognition: databases, features, and data fusion strategies. APSIPA Trans. Signal Inf. Process. 3, e12 (2014)","journal-title":"APSIPA Trans. Signal Inf. Process."},{"key":"4_CR38","doi-asserted-by":"crossref","unstructured":"Zeng, Z., Pantic, M., et\u00a0al.: A survey of affect recognition methods: audio, visual and spontaneous expressions. In: ICMI (2007)","DOI":"10.1145\/1322192.1322216"},{"key":"4_CR39","doi-asserted-by":"crossref","unstructured":"Zhang, S., Yang, Y., et\u00a0al.: Deep learning-based multimodal emotion recognition from audio, visual, and text modalities: a systematic review of recent advancements and future prospects. Expert Syst. Appl. 121692 (2023)","DOI":"10.1016\/j.eswa.2023.121692"},{"key":"4_CR40","doi-asserted-by":"crossref","unstructured":"Zhang, X., Li, M., et\u00a0al.: Transformer-based multimodal emotional perception for dynamic facial expression recognition in the wild. IEEE Trans. Circuits Syst. Video Technol. (2023)","DOI":"10.1109\/TCSVT.2023.3312858"},{"issue":"6","key":"4_CR41","doi-asserted-by":"publisher","first-page":"915","DOI":"10.1109\/TPAMI.2007.1110","volume":"29","author":"G Zhao","year":"2007","unstructured":"Zhao, G., Pietikainen, M.: Dynamic texture recognition using local binary patterns with an application to facial expressions. IEEE Trans. Pattern Anal. Mach. Intell. 29(6), 915\u2013928 (2007)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."}],"container-title":["Lecture Notes in Computer Science","Social Robotics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-96-1151-5_4","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,6]],"date-time":"2025-02-06T16:02:08Z","timestamp":1738857728000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-96-1151-5_4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9789819611508","9789819611515"],"references-count":41,"URL":"https:\/\/doi.org\/10.1007\/978-981-96-1151-5_4","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"7 February 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICSR + InnoBiz","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Social Robotics","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Shenzhen","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"26 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"16","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"socrob2024b","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/www.asianlp.sg\/conferences\/icsr2024\/web\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}