{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T18:17:42Z","timestamp":1771697862177,"version":"3.50.1"},"reference-count":24,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017,3]]},"DOI":"10.1109\/icassp.2017.7953072","type":"proceedings-article","created":{"date-parts":[[2017,6,20]],"date-time":"2017-06-20T21:35:36Z","timestamp":1497994536000},"page":"4820-4824","source":"Crossref","is-referenced-by-count":42,"title":["Knowledge distillation for small-footprint highway networks"],"prefix":"10.1109","author":[{"given":"Liang","family":"Lu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Michelle","family":"Guo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Steve","family":"Renals","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","article-title":"Distilling the knowledge in a neural network","author":"hinton","year":"2015","journal-title":"Proc NIPS Deep Learning and Representation Learning Workshop"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2016-39"},{"key":"ref12","article-title":"Training very deep networks","author":"srivastava","year":"2015","journal-title":"Proc NIPS"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/SLT.2016.7846304"},{"key":"ref14","article-title":"Long short-term memory recurrent neural network architectures for large scale acoustic modeling","author":"sak","year":"2014","journal-title":"Proc INTERSPEECH"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2014.2339736"},{"key":"ref16","article-title":"Scalable minimum bayes risk training of deep neural network acoustic models using distributed hessian-free optimization","author":"kingsbury","year":"2012","journal-title":"Proc In-terspeech"},{"key":"ref17","article-title":"Sequence-discriminative training of deep neural networks","author":"vesel\u00fd","year":"2013","journal-title":"Proc In-terspeech"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6638951"},{"key":"ref19","article-title":"Hypothesis spaces for minimum bayes risk training in large vocabulary speech recognition","author":"gibson","year":"2006","journal-title":"Proc INTERSPEECH"},{"key":"ref4","article-title":"Structured transforms for small-footprint deep learning","author":"sindhwani","year":"2015","journal-title":"Proc NIPS"},{"key":"ref3","article-title":"Fastfood-approximating kernel expansions in loglinear time","author":"le","year":"2013","journal-title":"Proc ICML"},{"key":"ref6","article-title":"Learning small-size DNN with output-distribution-based criteria","author":"li","year":"2014","journal-title":"Proc Inter-speech"},{"key":"ref5","article-title":"ACDC: A Structured Efficient Linear Layer","author":"moczulski","year":"2016","journal-title":"Proc ICLR"},{"key":"ref8","article-title":"Fitnets: Hints for thin deep nets","author":"adriana","year":"2015","journal-title":"Proc ICLR"},{"key":"ref7","first-page":"2654","article-title":"Do deep nets really need to be deep?","author":"ba","year":"2014","journal-title":"Proc NIPS"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6638949"},{"key":"ref1","first-page":"2365","article-title":"Restructuring of deep neural network acoustic models with singular value decomposition","author":"xue","year":"2013","journal-title":"Proc INTERSPEECH"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/1150402.1150464"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2009.4960445"},{"key":"ref22","article-title":"An introduction to computational networks and the computational network toolkit","author":"yu","year":"2014","journal-title":"Technical Report Technical Report Microsoft Research"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2007.4430116"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854672"},{"key":"ref23","article-title":"The Kaldi speech recognition toolkit","author":"povey","year":"2011","journal-title":"Proc ASRU"}],"event":{"name":"2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"New Orleans, LA","start":{"date-parts":[[2017,3,5]]},"end":{"date-parts":[[2017,3,9]]}},"container-title":["2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7943262\/7951776\/07953072.pdf?arnumber=7953072","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2017,8,29]],"date-time":"2017-08-29T18:44:22Z","timestamp":1504032262000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7953072\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,3]]},"references-count":24,"URL":"https:\/\/doi.org\/10.1109\/icassp.2017.7953072","relation":{},"subject":[],"published":{"date-parts":[[2017,3]]}}}