{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,9,8]],"date-time":"2024-09-08T10:43:10Z","timestamp":1725792190161},"reference-count":25,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,5]]},"DOI":"10.1109\/icsda.2018.8693020","type":"proceedings-article","created":{"date-parts":[[2019,4,19]],"date-time":"2019-04-19T00:49:38Z","timestamp":1555634978000},"page":"37-42","source":"Crossref","is-referenced-by-count":1,"title":["Multi-Modal Multi-Task Deep Learning For Speaker And Emotion Recognition Of TV-Series Data"],"prefix":"10.1109","author":[{"given":"Sashi","family":"Novitasari","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Quoc Truong","family":"Do","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sakriani","family":"Sakti","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dessi","family":"Lestari","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Satoshi","family":"Nakamura","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"doi-asserted-by":"publisher","key":"ref10","DOI":"10.1109\/IntelliSys.2017.8324265"},{"doi-asserted-by":"publisher","key":"ref11","DOI":"10.21437\/Interspeech.2009-103"},{"doi-asserted-by":"publisher","key":"ref12","DOI":"10.21437\/Interspeech.2010-739"},{"key":"ref13","doi-asserted-by":"crossref","first-page":"415","DOI":"10.1007\/978-3-642-24571-8_53","article-title":"AVEC 2011 - the first international audio\/visual emotion challenge","author":"schuller","year":"2011","journal-title":"Proceedings of the International Conference on Affective Computing & Intelligent Interaction"},{"key":"ref14","first-page":"61","article-title":"Classification of emotional speech in anime films by using automatic temporal segmentation","author":"hara","year":"2010","journal-title":"Proc of the second International Conference on Creative Content Technologies (CONTENT)"},{"doi-asserted-by":"publisher","key":"ref15","DOI":"10.1109\/TMM.2012.2233724"},{"key":"ref16","first-page":"10","article-title":"Audio-visual emotion recognition: A dynamic, multimodal approach","author":"jeremie","year":"2014"},{"doi-asserted-by":"publisher","key":"ref17","DOI":"10.1109\/SLT.2016.7846319"},{"doi-asserted-by":"publisher","key":"ref18","DOI":"10.1016\/j.sigpro.2006.02.045"},{"doi-asserted-by":"publisher","key":"ref19","DOI":"10.1109\/APSIPA.2016.7820893"},{"doi-asserted-by":"publisher","key":"ref4","DOI":"10.1007\/978-3-319-66429-3_63"},{"doi-asserted-by":"publisher","key":"ref3","DOI":"10.1121\/1.405558"},{"doi-asserted-by":"publisher","key":"ref6","DOI":"10.1109\/SIU.2010.5649919"},{"doi-asserted-by":"publisher","key":"ref5","DOI":"10.1093\/ietisy\/e88-d.11.2484"},{"key":"ref8","first-page":"173","article-title":"Automatic speaker recognition using gaussian mixture speaker models","author":"reynolds","year":"1995","journal-title":"THE LINCOLN LABORATORY JOURNAL"},{"doi-asserted-by":"publisher","key":"ref7","DOI":"10.1049\/iet-spr.2016.0336"},{"key":"ref2","doi-asserted-by":"crossref","DOI":"10.7551\/mitpress\/1140.001.0001","author":"picard","year":"1997","journal-title":"Affective Computing"},{"doi-asserted-by":"publisher","key":"ref9","DOI":"10.14257\/ijsip.2014.7.1.11"},{"doi-asserted-by":"publisher","key":"ref1","DOI":"10.1121\/1.1913238"},{"key":"ref20","article-title":"Towards Speech Emotion Recognition &#x201C;in the wild&#x201D; using Aggregated Corpora and Deep Multi-Task Learning","author":"kim","year":"2017","journal-title":"ArXiv e-prints"},{"key":"ref22","first-page":"3111","article-title":"Distributed representations of words and phrases and their compositionality","author":"mikolov","year":"2013","journal-title":"Proceedings of the 26th International Conference on Neural Information Processing Systems"},{"doi-asserted-by":"publisher","key":"ref21","DOI":"10.1145\/1873951.1874246"},{"year":"2018","author":"sakti","article-title":"Construction of english-french multimodal affective conversational corpus from tv dramas","key":"ref24"},{"doi-asserted-by":"publisher","key":"ref23","DOI":"10.1109\/WACV.2016.7477553"},{"doi-asserted-by":"publisher","key":"ref25","DOI":"10.1109\/ACII.2013.126"}],"event":{"name":"2018 Oriental COCOSDA - International Conference on Speech Database and Assessments","start":{"date-parts":[[2018,5,7]]},"location":"Miyazaki, Japan","end":{"date-parts":[[2018,5,8]]}},"container-title":["2018 Oriental COCOSDA - International Conference on Speech Database and Assessments"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8688812\/8693003\/08693020.pdf?arnumber=8693020","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,7,17]],"date-time":"2024-07-17T02:36:00Z","timestamp":1721183760000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8693020\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,5]]},"references-count":25,"URL":"https:\/\/doi.org\/10.1109\/icsda.2018.8693020","relation":{},"subject":[],"published":{"date-parts":[[2018,5]]}}}