{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T01:06:56Z","timestamp":1740100016211,"version":"3.37.3"},"reference-count":25,"publisher":"IEEE","license":[{"start":{"date-parts":[[2021,6,6]],"date-time":"2021-06-06T00:00:00Z","timestamp":1622937600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,6,6]],"date-time":"2021-06-06T00:00:00Z","timestamp":1622937600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,6,6]],"date-time":"2021-06-06T00:00:00Z","timestamp":1622937600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/100005537","name":"National Association of Broadcasters","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100005537","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,6,6]]},"DOI":"10.1109\/icassp39728.2021.9414169","type":"proceedings-article","created":{"date-parts":[[2021,5,13]],"date-time":"2021-05-13T19:53:45Z","timestamp":1620935625000},"page":"6189-6193","source":"Crossref","is-referenced-by-count":4,"title":["DEEPTALK: Vocal Style Encoding for Speaker Recognition and Speech Synthesis"],"prefix":"10.1109","author":[{"given":"Anurag","family":"Chowdhury","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Arun","family":"Ross","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Prabu","family":"David","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","article-title":"Style tokens: Unsupervised style modeling, control and transfer in end-to-end speech synthesis","author":"wang","year":"2018","journal-title":"ICML"},{"key":"ref11","article-title":"Master thesis: Automatic multi-speaker voice cloning","author":"jemine","year":"2019","journal-title":"Universite de Liege Liege Belgique"},{"key":"ref12","article-title":"DeepVOX: Discovering features from raw audio for speaker recognition in degraded audio signals","author":"chowdhury","year":"2020","journal-title":"arXiv preprint arXiv 2008 11668"},{"key":"ref13","article-title":"Efficient neural audio synthesis","author":"kalchbrenner","year":"2018","journal-title":"ICML"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2018-1929"},{"year":"0","key":"ref15","article-title":"2008 NIST speaker recognition evaluation training set part 2 ldc2011s07"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1016\/0167-6393(93)90095-3"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2064307"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461375"},{"key":"ref19","article-title":"MSR identity toolbox v1.0: A MATLAB toolbox for speaker-recognition research","author":"sadjadi","year":"2013","journal-title":"Speech and Language Processing Technical Committee Newsletter"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICSLP.1996.607979"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1121\/1.4987208"},{"key":"ref6","article-title":"Study on speaker verification on emotional speech","author":"wu","year":"2006","journal-title":"ICSLP"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2003.1202761"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2005.02.018"},{"key":"ref7","first-page":"13","article-title":"Sistema multiparam&#x00E9;trico para la comparacion forense de hablantes","author":"segundo","year":"2019","journal-title":"Estudios de fon&#x00E9;tica experimental"},{"key":"ref2","article-title":"Voice recognition algorithms using mel frequency cepstral coefficient (MFCC) and dynamic time warping (DTW) techniques","author":"muda","year":"2010","journal-title":"Journal of Computing"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461368"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TIFS.2019.2941773"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178964"},{"key":"ref22","article-title":"Prosodic features for speaker verification","author":"mary","year":"2006","journal-title":"ICSLP"},{"key":"ref21","article-title":"Transfer learning from speaker verification to multispeaker text-to-speech synthesis","author":"jia","year":"2018","journal-title":"NeurIPS"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2020.07.009"},{"key":"ref23","article-title":"Visualizing data using t-SNE","author":"der maaten","year":"2008","journal-title":"JMLR"},{"key":"ref25","article-title":"Fraudsters used AI to mimic CEO&#x2019;s voice in unusual cybercrime case","volume":"30","author":"stupp","year":"2019","journal-title":"The Wall Street Journal"}],"event":{"name":"ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","start":{"date-parts":[[2021,6,6]]},"location":"Toronto, ON, Canada","end":{"date-parts":[[2021,6,11]]}},"container-title":["ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9413349\/9413350\/09414169.pdf?arnumber=9414169","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,10]],"date-time":"2022-05-10T15:41:07Z","timestamp":1652197267000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9414169\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,6,6]]},"references-count":25,"URL":"https:\/\/doi.org\/10.1109\/icassp39728.2021.9414169","relation":{},"subject":[],"published":{"date-parts":[[2021,6,6]]}}}