{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T20:45:53Z","timestamp":1782420353931,"version":"3.54.5"},"reference-count":37,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"Science Committee, Republic of Armenia","award":["23RL-1B028"],"award-info":[{"award-number":["23RL-1B028"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/access.2026.3703882","type":"journal-article","created":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T19:48:16Z","timestamp":1781552896000},"page":"93027-93041","source":"Crossref","is-referenced-by-count":0,"title":["ProtoGEN: A Prototype-Guided Emotion Network for Multimodal Speech Emotion Recognition"],"prefix":"10.1109","volume":"14","author":[{"given":"Levon A.","family":"Avetisyan","sequence":"first","affiliation":[{"name":"Russian-Armenian University, Yerevan, Armenia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1536-9954","authenticated-orcid":false,"given":"Shahane T.","family":"Tigranyan","sequence":"additional","affiliation":[{"name":"IIAP NAS RA, Yerevan, Armenia"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Aram A.","family":"Avetisyan","sequence":"additional","affiliation":[{"name":"Trusted AI Research Center, RAS, Moscow, Russia"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","volume-title":"Aniemore","author":"Lubenets","year":"2022"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.3390\/math10142373"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2023-311"},{"key":"ref4","article-title":"Speech emotion recognition using support vector machine","author":"Jain","year":"2020","journal-title":"arXiv:2002.07590"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ELECO.2015.7394435"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW54120.2021.00393"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2021.114683"},{"key":"ref8","article-title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations","author":"Baevski","year":"2020","journal-title":"arXiv:2006.11477"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3122291"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2022.3188113"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/s10579-008-9076-6"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1050"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.5281\/zenodo.1188976"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2005-446"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1212"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.3390\/math11163519"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1570"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-651"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.931"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01457"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/3650212.3652145"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-99579-3_52"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.21437\/ICSLP.2002-560"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-96-0579-8_9"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1145\/1873951.1874246"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2015.2457417"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2025-703"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-2525"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2023-1591"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1162"},{"key":"ref31","article-title":"Efficient estimation of word representations in vector space","author":"Mikolov","year":"2013","journal-title":"arXiv:1301. 3781"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR48806.2021.9413144"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.2307\/2346806"},{"key":"ref34","article-title":"NeMo: A toolkit for building AI applications using neural modules","author":"Kuchaiev","year":"2019","journal-title":"arXiv:1909.09577"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-280"},{"key":"ref36","article-title":"A family of pretrained transformer language models for Russian","author":"Zmitrovich","year":"2023","journal-title":"arXiv:2309.10931"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9054441"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/11323511\/11563774.pdf?arnumber=11563774","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T19:45:55Z","timestamp":1782416755000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11563774\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":37,"URL":"https:\/\/doi.org\/10.1109\/access.2026.3703882","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}