{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,29]],"date-time":"2025-11-29T06:51:22Z","timestamp":1764399082938,"version":"3.46.0"},"reference-count":54,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,22]],"date-time":"2025-10-22T00:00:00Z","timestamp":1761091200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,22]],"date-time":"2025-10-22T00:00:00Z","timestamp":1761091200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100020595","name":"National Science and Technology Council","doi-asserted-by":"publisher","award":["114-2917-I-564-022"],"award-info":[{"award-number":["114-2917-I-564-022"]}],"id":[{"id":"10.13039\/100020595","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,22]]},"DOI":"10.1109\/apsipaasc65261.2025.11249090","type":"proceedings-article","created":{"date-parts":[[2025,11,28]],"date-time":"2025-11-28T18:40:26Z","timestamp":1764355226000},"page":"2592-2597","source":"Crossref","is-referenced-by-count":0,"title":["Enabling Internationalization of Affective Speech Technology Using LLMs"],"prefix":"10.1109","author":[{"given":"Bo-Hao","family":"Su","sequence":"first","affiliation":[{"name":"Language Technologies Institute, Carnegie Mellon University,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shinji","family":"Watanabe","sequence":"additional","affiliation":[{"name":"Language Technologies Institute, Carnegie Mellon University,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chi-Chun","family":"Lee","sequence":"additional","affiliation":[{"name":"Electrical Engineering, National Tsing Hua University,Taiwan"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-92977-9_19"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1108\/JSM-07-2023-0284"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-60405-8_26"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ACIIW52867.2021.9666308"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1049\/htl2.12040"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.54216\/fpa.100104"},{"journal-title":"Qwen2-audio technical report","year":"2024","author":"Chu","key":"ref7"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.3389\/fpsyg.2024.1350631"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1016\/j.isci.2024.109175"},{"key":"ref10","first-page":"30","article-title":"Spirit-lm: Interleaved spoken and written language model","volume":"13","author":"Nguyen","year":"2025","journal-title":"Transactions of the Association for Computational Linguistics"},{"journal-title":"Audiopalm: A large language model that can speak and listen","year":"2023","author":"Rubenstein","key":"ref11"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-long.80"},{"journal-title":"Speechverse: A large-scale generalizable audio language model","year":"2024","author":"Das","key":"ref13"},{"journal-title":"Salmonn: Towards generic hearing abilities for large language models","year":"2023","author":"Tang","key":"ref14"},{"journal-title":"Seed-tts: A family of high-quality versatile speech generation models","year":"2024","author":"Anastassiou","key":"ref15"},{"journal-title":"Phi-4 technical report","year":"2024","author":"Abdin","key":"ref16"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10096370"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10446974"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10446496"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2024.3372380"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2024.3360979"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3263585"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-1941"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10446191"},{"journal-title":"Durflexevc: Duration-flexible emotional voice conversion with parallel generation","year":"2024","author":"Oh","key":"ref25"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49660.2025.10889084"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.21437\/odyssey.2024-25"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2024.3433386"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10446548"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9746598"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9414654"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2022.3167013"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2021.3135152"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-1248"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2022.3146325"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2023.3238007"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1145\/3704522.3704527"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2022.3205919"},{"journal-title":"Audio flamingo 3: Advancing audio intelligence with fully open large audio language models","year":"2025","author":"Goel","key":"ref39"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.52202\/079017-0427"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2025-874"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10445906"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10448130"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10448316"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49660.2025.10889305"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ACII59096.2023.10388175"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9414542"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1007\/s10579-008-9076-6"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2017.2736999"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1050"},{"journal-title":"Ov-mer: Towards openvocabulary multimodal emotion recognition","year":"2024","author":"Lian","key":"ref51"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1177\/00220221241285006"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1111\/j.1745-6916.2007.00043.x"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1037\/0022-3514.90.2.288"}],"event":{"name":"2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)","start":{"date-parts":[[2025,10,22]]},"location":"Singapore, Singapore","end":{"date-parts":[[2025,10,24]]}},"container-title":["2025 Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11248853\/11248968\/11249090.pdf?arnumber=11249090","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,29]],"date-time":"2025-11-29T06:50:10Z","timestamp":1764399010000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11249090\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,22]]},"references-count":54,"URL":"https:\/\/doi.org\/10.1109\/apsipaasc65261.2025.11249090","relation":{},"subject":[],"published":{"date-parts":[[2025,10,22]]}}}