{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T15:50:02Z","timestamp":1783439402964,"version":"3.54.6"},"reference-count":57,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,4,6]],"date-time":"2025-04-06T00:00:00Z","timestamp":1743897600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,4,6]],"date-time":"2025-04-06T00:00:00Z","timestamp":1743897600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,4,6]]},"DOI":"10.1109\/icassp49660.2025.10889998","type":"proceedings-article","created":{"date-parts":[[2025,3,12]],"date-time":"2025-03-12T13:52:43Z","timestamp":1741787563000},"page":"1-5","source":"Crossref","is-referenced-by-count":15,"title":["LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations"],"prefix":"10.1109","author":[{"given":"Soumya","family":"Dutta","sequence":"first","affiliation":[{"name":"Electrical Engineering Indian Institute of Science Bangalore,LEAP Lab,Bangalore,India"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sriram","family":"Ganapathy","sequence":"additional","affiliation":[{"name":"Electrical Engineering Indian Institute of Science Bangalore,LEAP Lab,Bangalore,India"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1145\/1101149.1101299"},{"key":"ref2","article-title":"Emotion detection and analysis on social media","author":"Gaind","year":"2019"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683679"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/COMSNETS.2019.8711078"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1038\/s41597-020-00630-y"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2019.2929050"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1016\/j.procs.2017.05.025"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1093\/oso\/9780195126013.003.0023"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-34584-5_37"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-15184-2_9"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2017.02.003"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1121\/1.1918222"},{"key":"ref13","first-page":"22","article-title":"Emotion in speech: Recognition and application to call centers","volume-title":"Proceedings of artificial neural networks in engineering","volume":"710","author":"Petrushin"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2018-1811"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461431"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747723"},{"key":"ref17","first-page":"12 449","article-title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","volume":"33","author":"Baevski","year":"2020","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3122291"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2022.3188113"},{"key":"ref20","article-title":"SALMONN: Towards generic hearing abilities for large language models","author":"Tang","year":"2023"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.263"},{"key":"ref22","first-page":"417","article-title":"Sentiwordnet: A publicly available lexical resource for opinion mining","volume-title":"Proceedings of the 5th international conference on language resources and evaluation","author":"Sebastiani"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1162\/COLI_a_00049"},{"key":"ref24","first-page":"1746","article-title":"Convolutional neural networks for sentence classification","volume-title":"Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP)","author":"Kim"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1080"},{"key":"ref26","first-page":"4171","article-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","author":"Devlin","year":"2019","journal-title":"NAACL-HLT"},{"key":"ref27","first-page":"187","article-title":"Aspect-based sentiment analysis using bert","volume-title":"Proceedings of the 22nd nordic conference on computational linguistics","author":"Hoang"},{"key":"ref28","article-title":"Roberta: A robustly optimized bert pretraining approach","author":"Liu","year":"2019"},{"issue":"140","key":"ref29","first-page":"1","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel","year":"2020","journal-title":"Journal of machine learning research"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-naacl.246"},{"key":"ref31","article-title":"HCAM\u2013Hierarchical Cross Attention Model for Multi-modal Emotion Recognition","author":"Dutta","year":"2023"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/d19-1015"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-acl.126"},{"key":"ref34","first-page":"28 492","article-title":"Robust speech recognition via large-scale weak supervision","volume-title":"International conference on machine learning","author":"Radford"},{"key":"ref35","article-title":"Leveraging content and acoustic representations for efficient speech emotion recognition","author":"Dutta","year":"2024"},{"key":"ref36","article-title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","volume":"32","author":"Lu","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/s10579-008-9076-6"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1050"},{"key":"ref39","article-title":"MOSI: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos","author":"Zadeh","year":"2016"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.newsum-1.1"},{"key":"ref41","article-title":"Can chatgpt understand too? a comparative study on chatgpt and fine-tuned bert","author":"Zhong","year":"2023"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9746464"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.606"},{"key":"ref44","article-title":"Hierarchical dialogue understanding with special tokens and turn-level attention","author":"Liu","year":"2023"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-naacl.282"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053569"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2021-1775"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2023-2078"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2017.2736999"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P17-1081"},{"key":"ref51","article-title":"Decoupled weight decay regularization","volume-title":"7th International Conference on Learning Representations, ICLR 2019, New Orleans, LA, USA, May 6-9, 2019","author":"Loshchilov"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2019.2925966"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i02.5492"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.findings-emnlp.229"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2022.3141237"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.emnlp-main.534"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.naacl-long.5"}],"event":{"name":"ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Hyderabad, India","start":{"date-parts":[[2025,4,6]]},"end":{"date-parts":[[2025,4,11]]}},"container-title":["ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10887540\/10887541\/10889998.pdf?arnumber=10889998","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T05:23:57Z","timestamp":1774416237000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10889998\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,6]]},"references-count":57,"URL":"https:\/\/doi.org\/10.1109\/icassp49660.2025.10889998","relation":{},"subject":[],"published":{"date-parts":[[2025,4,6]]}}}