{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,30]],"date-time":"2026-07-30T15:11:26Z","timestamp":1785424286832,"version":"3.56.0"},"reference-count":229,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"8","license":[{"start":{"date-parts":[[2019,8,1]],"date-time":"2019-08-01T00:00:00Z","timestamp":1564617600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/OAPA.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2019,8,1]]},"DOI":"10.1109\/tpami.2018.2889774","type":"journal-article","created":{"date-parts":[[2018,12,25]],"date-time":"2018-12-25T19:46:40Z","timestamp":1545767200000},"page":"2008-2026","source":"Crossref","is-referenced-by-count":500,"title":["Advances in Variational Inference"],"prefix":"10.1109","volume":"41","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8640-9370","authenticated-orcid":false,"given":"Cheng","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5344-8042","authenticated-orcid":false,"given":"Judith","family":"Butepage","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hedvig","family":"Kjellstrom","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Stephan","family":"Mandt","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1214\/13-BA858"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.1613\/jair.251"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1162\/089976601750265045"},{"key":"ref174","article-title":"Expectation propagation for exponential families","author":"seeger","year":"2005"},{"key":"ref173","first-page":"1889","article-title":"Trust region policy optimization","author":"schulman","year":"2015","journal-title":"Proc 31st Int Conf Mach Learn"},{"key":"ref176","article-title":"ZhuSuan: A library for Bayesian deep learning","author":"shi","year":"2017","journal-title":"arXiv 1709 05870"},{"key":"ref175","first-page":"1594","article-title":"An empirical study of stochastic variational algorithms for the beta bernoulli process","author":"shah","year":"2015","journal-title":"Proceedings of the 32nd Intl Conf on Machine Learning"},{"key":"ref178","article-title":"How to train deep variational autoencoders and probabilistic ladder networks","author":"s\u00f8nderby","year":"2016","journal-title":"Proc 33rd Int Conf Mach Learn"},{"key":"ref177","first-page":"1257","article-title":"Sparse Gaussian processes using pseudo-inputs","author":"snelson","year":"2006","journal-title":"Proc 18th Int Conf Neural Inf Process Syst"},{"key":"ref168","first-page":"1309","article-title":"Multimodal prediction and personalization of photo edits with deep generative models","author":"saeedi","year":"0","journal-title":"AISTATS"},{"key":"ref169","first-page":"1218","article-title":"Markov Chain Monte Carlo and variational inference: Bridging the gap","author":"salimans","year":"2015","journal-title":"Proceedings of the 32nd Intl Conf on Machine Learning"},{"key":"ref39","first-page":"2732","article-title":"Variational inference via chi-upper bound minimization","author":"dieng","year":"2017","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.637"},{"key":"ref33","first-page":"95","article-title":"Eine informationstheoretische ungleichung und ihre anwendung auf beweis der ergodizitaet von markoffschen ketten","volume":"8","author":"csisz\u00e1r","year":"1964","journal-title":"Magyer Tud Akad Mat Kutato Int Koezl"},{"key":"ref32","first-page":"1","article-title":"Importance sampling for minibatches","volume":"19","author":"csiba","year":"2018","journal-title":"JMLR"},{"key":"ref31","article-title":"Reinterpreting importance-weighted autoencoders","author":"cremer","year":"2017","journal-title":"Proc Workshop Int Conf Learn Represent"},{"key":"ref30","first-page":"1078","article-title":"Inference suboptimality in variational autoencoders","author":"cremer","year":"2018","journal-title":"Proc 29th Int Conf Mach Learn"},{"key":"ref37","first-page":"718","article-title":"Automated inference using adaptive batch sizes","author":"de","year":"2017","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1995.7.5.889"},{"key":"ref35","first-page":"207","article-title":"Deep Gaussian processes","author":"damianou","year":"2013","journal-title":"Proc 16th Int Conf Artif Intell Statist"},{"key":"ref34","article-title":"Variational auto-encoded deep Gaussian processes","author":"dai","year":"2016","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref181","first-page":"583","article-title":"A bound for the error in the normal approximation to the distribution of a sum of dependent random variables","author":"stein","year":"1972","journal-title":"Proc Berkeley Symp Math Statist Probability"},{"key":"ref180","article-title":"Autoencoding variational inference for topic models","author":"srivastava","year":"2017","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref185","first-page":"554","article-title":"Estimation of third-order correlations within mean field approximation","author":"tanaka","year":"1998","journal-title":"Proc 5th Int Conf Neural Inf Process Syst"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1007\/s11222-015-9618-x"},{"key":"ref183","volume":"1","author":"sutton","year":"1998","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref182","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2008.157"},{"key":"ref189","first-page":"2503","article-title":"A trust-region method for stochastic variational inference with applications to streaming data","author":"theis","year":"2015","journal-title":"Proceedings of the 32nd Intl Conf on Machine Learning"},{"key":"ref188","first-page":"1353","article-title":"A collapsed variational Bayesian inference algorithm for latent Dirichlet allocation","author":"teh","year":"2006","journal-title":"Proc 19th Int Conf Neural Inf Process Syst"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1162\/089976600300015213"},{"key":"ref186","first-page":"351","article-title":"A theory of mean field approximation","author":"tanaka","year":"1999","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref28","first-page":"1","article-title":"Stan: A probabilistic programming language","volume":"76","author":"carpenter","year":"2016","journal-title":"J Statist Software"},{"key":"ref27","author":"le cam","year":"0","journal-title":"Asymptotic Methods in Statistical Decision Theory"},{"key":"ref179","article-title":"On integral probability metrics,$\\backslash$?phi-divergences and binary classification","author":"sriperumbudur","year":"2009","journal-title":"arXiv preprint arXiv 0901 2698"},{"key":"ref29","article-title":"Variational lossy autoencoder","author":"chen","year":"2017","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1016\/0304-405X(77)90005-8"},{"key":"ref22","doi-asserted-by":"crossref","DOI":"10.1201\/b10905","author":"brooks","year":"2011","journal-title":"Handbook of Markov Chain Monte Carlo"},{"key":"ref21","first-page":"1727","article-title":"Streaming variational bayes","author":"broderick","year":"2013","journal-title":"Proc 26th Int Conf Neural Inf Process Syst"},{"key":"ref24","first-page":"1","article-title":"A unifying framework for sparse gaussian process approximation using power expectation propagation","volume":"18","author":"bui","year":"2016","journal-title":"JMLR"},{"key":"ref23","first-page":"668","article-title":"Quasi-Monte Carlo Variational Inference","author":"buchholz","year":"2018","journal-title":"Proc 35th Int Conf Mach Learn"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-012-0572-5"},{"key":"ref25","article-title":"Importance weighted autoencoders","author":"burda","year":"2016","journal-title":"ICLRE"},{"key":"ref50","first-page":"517","article-title":"Amortized inference in probabilistic reasoning","volume":"36","author":"gershman","year":"2014","journal-title":"Proc 3rd Annu Meeting of the Cogn Sci Soc"},{"key":"ref51","first-page":"663","article-title":"Nonparametric variational inference","author":"gershman","year":"2012","journal-title":"Proc 29th Int Conf Mach Learn"},{"key":"ref154","first-page":"814","article-title":"Black box variational inference","author":"ranganath","year":"2014","journal-title":"Proc 17th Int Conf Artif Intell Statist"},{"key":"ref153","first-page":"4277","article-title":"Tighter variational bounds are not necessarily better","author":"rainforth","year":"2018","journal-title":"Proc 35th Int Conf Mach Learn"},{"key":"ref156","first-page":"2568","article-title":"Hierarchical variational models","author":"ranganath","year":"2016","journal-title":"Proc 33rd Int Conf Mach Learn"},{"key":"ref155","first-page":"496","article-title":"Operator variational inference","author":"ranganath","year":"2016","journal-title":"Proc 30th Int Conf Neural Inf Process Syst"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1088\/0305-4470\/15\/6\/035"},{"key":"ref152","first-page":"4267","article-title":"On Nesting Monte Carlo Estimators","author":"rainforth","year":"2018","journal-title":"Proc 35th Int Conf Mach Learn"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1145\/1401890.1401960"},{"key":"ref146","first-page":"1363","article-title":"Variational Bayesian inference with stochastic search","author":"paisley","year":"2012","journal-title":"Proc 29th Int Conf Mach Learn"},{"key":"ref147","author":"parisi","year":"1988","journal-title":"Statistical Field Theory"},{"key":"ref148","first-page":"869","article-title":"Faster coordinate descent via adaptive importance sampling","year":"2017","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref149","first-page":"995","article-title":"A mean field theory learning algorithm for neural networks","volume":"1","author":"peterson","year":"1987","journal-title":"Complex Syst"},{"key":"ref59","article-title":"Stein variational adaptive importance sampling","author":"han","year":"2017","journal-title":"Proc Int Conf Uncertainty Artif Intell"},{"key":"ref58","article-title":"Boosting variational inference","author":"guo","year":"2016","journal-title":"NeurIPS WS Adv Approx Bayesian Inference"},{"key":"ref57","article-title":"PixelVAE: A latent variable model for natural images","author":"gulrajani","year":"2017","journal-title":"ICLRE"},{"key":"ref56","first-page":"1462","article-title":"Draw: A recurrent neural network for image generation","author":"gregor","year":"2015","journal-title":"Proceedings of the 32nd Intl Conf on Machine Learning"},{"key":"ref55","first-page":"2249","article-title":"Scalable inference of overlapping communities","author":"gopalan","year":"2012","journal-title":"Proc 25th Int Conf Neural Inf Process Syst"},{"key":"ref54","first-page":"2672","article-title":"Generative adversarial nets","author":"goodfellow","year":"2014","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref53","author":"goodfellow","year":"2016","journal-title":"Deep Learning"},{"key":"ref52","doi-asserted-by":"crossref","first-page":"452","DOI":"10.1038\/nature14541","article-title":"Probabilistic machine learning and artificial intelligence","volume":"521","author":"ghahramani","year":"2015","journal-title":"Nature"},{"key":"ref40","article-title":"NICE: Non-linear independent components estimation","author":"dinh","year":"2015","journal-title":"ICLR-WS"},{"key":"ref167","first-page":"647","article-title":"Overdispersed black-box variational inference","author":"ruiz","year":"2016","journal-title":"Proc Int Conf Uncertainty Artificial Intell"},{"key":"ref166","first-page":"460","article-title":"The generalized reparameterization gradient","author":"ruiz","year":"2016","journal-title":"Proc 30th Int Conf Neural Inf Process Syst"},{"key":"ref165","author":"ross","year":"2006","journal-title":"Simulation"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.1016\/0167-8655(90)90010-Y"},{"key":"ref163","article-title":"Discrete variational autoencoders","author":"rolfe","year":"2017","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref162","first-page":"6925","article-title":"Sticking the landing: An asymptotically zero-variance gradient estimator for variational inference","author":"roeder","year":"2017","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177729586"},{"key":"ref160","first-page":"ii-1278","article-title":"Stochastic backpropagation and approximate inference in deep generative models","author":"rezende","year":"2014","journal-title":"Proc 31st Int Conf Mach Learn"},{"key":"ref4","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4612-5056-2","author":"amari","year":"1985","journal-title":"Differential-Geometrical Methods in Statistics"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1111\/j.2517-6161.1966.tb00626.x"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.2009.2030485"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1162\/089976698300017746"},{"key":"ref8","first-page":"234","article-title":"Efficient gradient-free variational inference using policy search","author":"arenz","year":"2018","journal-title":"Proc 35th Int Conf Mach Learn"},{"key":"ref159","first-page":"1530","article-title":"Variational inference with normalizing flows","author":"rezende","year":"2015","journal-title":"Proceedings of the 32nd Intl Conf on Machine Learning"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1561\/2200000052"},{"key":"ref49","first-page":"3257","article-title":"Distributed variational inference in sparse gaussian process regression and latent variable models","author":"gal","year":"2014","journal-title":"Proc 27th Int Conf Neural Inf Process Syst"},{"key":"ref157","first-page":"ii-298","article-title":"An adaptive learning rate for stochastic variational inference","author":"ranganath","year":"2013","journal-title":"Proc 30th Int Conf Mach Learn"},{"key":"ref9","first-page":"28","article-title":"Laplace's method approximations for probabilistic inferencein belief networks with continuous variables","author":"azevedo-filho and","year":"1994","journal-title":"Proc 10th Conf Uncertainty in Artif Intell"},{"key":"ref158","article-title":"Expectation propagation","author":"raymond","year":"2014","journal-title":"arXiv 1409 6179"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1137\/110830629"},{"key":"ref45","first-page":"3599","article-title":"Stochastic variational inference for hidden Markov models","author":"foti","year":"2014","journal-title":"Proc 27th Int Conf Neural Inf Process Syst"},{"key":"ref48","article-title":"Uncertainty in deep learning","author":"gal","year":"2016"},{"key":"ref47","first-page":"841","article-title":"CPSG-MCMC: Clustering-based preprocessing method for stochastic gradient MCMC","author":"fu","year":"2017","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref42","first-page":"2121","article-title":"Adaptive subgradient methods for online learning and stochastic optimization","volume":"12","author":"duchi","year":"2011","journal-title":"Journal of Machine Learning Research"},{"key":"ref41","article-title":"Density estimation using real NVP","author":"dinh","year":"2017","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1016\/S0959-440X(96)80056-X"},{"key":"ref43","first-page":"1070","article-title":"Early stopping as nonparametric variational inference","author":"duvenaud","year":"2016","journal-title":"Proc 19th Int Conf Artif Intell"},{"key":"ref73","first-page":"528","article-title":"Fast learning by bounding likelihoods in sigmoid type belief networks","author":"jaakkol","year":"1996","journal-title":"Proc 8th Int Conf Neural Inf Process Syst"},{"key":"ref72","article-title":"Variational inference using implicit distributions","author":"husz\u00e1r","year":"2017","journal-title":"arXiv 1702 08235"},{"key":"ref71","first-page":"803","article-title":"Online variational Bayesian learning","author":"honkela","year":"2003","journal-title":"ICA"},{"key":"ref70","first-page":"305","article-title":"Natural conjugate gradient in variational inference","author":"honkela","year":"2007","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref76","first-page":"ii-1854","article-title":"Stochastic variational inference for Bayesian time series models","author":"johnson","year":"2014","journal-title":"Proc 31st Int Conf Mach Learn"},{"key":"ref77","first-page":"2946","article-title":"Structured VAEs: Composing probabilistic graphical models and variational autoencoders","author":"johnson","year":"2016","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1007\/978-94-011-5014-9_6"},{"key":"ref75","article-title":"Categorical reparameterization with gumbel-softmax","author":"jang","year":"2017","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref78","first-page":"315","article-title":"Accelerating stochastic gradient descent using predictive variance reduction","author":"johnson","year":"2013","journal-title":"Proc 26th Int Conf Neural Inf Process Syst"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1023\/A:1007665907178"},{"key":"ref60","first-page":"829","article-title":"Variational Gaussian copula inference","author":"han","year":"2016","journal-title":"Proc 19th Int Conf Artif Intell"},{"key":"ref62","article-title":"Approximate inference in graphical models","author":"hennig","year":"2011"},{"key":"ref61","article-title":"Parameter estimation for text analysis","author":"heinrich","year":"2008"},{"key":"ref63","first-page":"272","article-title":"Gaussian processes for big data","author":"hensman","year":"2013","journal-title":"Proc Int Conf Uncertainty Artif Intell"},{"key":"ref64","first-page":"2888","article-title":"Fast variational inference in the conjugate exponential family","author":"hensman","year":"2012","journal-title":"Proc 25th Int Conf Neural Inf Process Syst"},{"key":"ref65","first-page":"856","article-title":"Online learning for Latent Dirichlet Allocation","author":"hoffman","year":"2010","journal-title":"Proc 23rd Int Conf Neural Inf Process Syst"},{"key":"ref66","first-page":"361","article-title":"Structured stochastic variational inference","author":"hoffman","year":"2015","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref67","first-page":"1303","article-title":"Stochastic variational inference","volume":"14","author":"hoffman","year":"2013","journal-title":"Journal of Machine Learning Research"},{"key":"ref68","author":"hogg","year":"1995","journal-title":"Introduction to Mathematical Statistics"},{"key":"ref69","first-page":"3235","article-title":"Approximate Riemannian conjugate gradient learning for fixed-form variational bayes","volume":"11","author":"honkela","year":"2010","journal-title":"Journal of Machine Learning Research"},{"key":"ref197","first-page":"841","article-title":"Variational heteroscedastic Gaussian process regression","author":"titsias","year":"2011","journal-title":"Proc 28th Int Conf Mach Learn"},{"key":"ref198","doi-asserted-by":"publisher","DOI":"10.1145\/3064899.3064910"},{"key":"ref199","first-page":"3564","article-title":"Copula variational inference","author":"tran","year":"2015","journal-title":"Proc 28th Int Conf Neural Inf Process Syst"},{"key":"ref193","article-title":"The information bottleneck method","author":"tishby","year":"2000","journal-title":"Arxiv Preprint Physics\/0004057"},{"key":"ref194","first-page":"2638","article-title":"Local expectation gradients for black box variational inference","author":"titsias","year":"2015","journal-title":"Proc 28th Int Conf Neural Inf Process Syst"},{"key":"ref195","first-page":"567","article-title":"Variational learning of inducing variables in sparse gaussian processes","author":"titsias","year":"2009","journal-title":"Proc 12th Int Conf Artif Intell Statist"},{"key":"ref196","article-title":"Learning model reparametrizations: Implicit variational inference by fitting MCMC distributions","author":"titsias","year":"0","journal-title":"arXiv 1708 01529"},{"key":"ref95","first-page":"416","article-title":"Approximate inference for the loss-calibrated Bayesian","author":"lacoste-julien","year":"2011","journal-title":"Proc 14th Int Conf Artif Intell Statist"},{"key":"ref94","first-page":"2796","article-title":"Collapsed variational Dirichlet process mixture models","author":"kurihara","year":"2007","journal-title":"Proc 20th Int Joint Conf Artif Intell"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1080\/14786437708235992"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177729694"},{"key":"ref191","first-page":"26","article-title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent magnitude","volume":"4","author":"tieleman","year":"2012","journal-title":"Neural Netw Mach Learning"},{"key":"ref92","first-page":"444","article-title":"Population empirical Bayes","author":"kucukelbir","year":"2015","journal-title":"Proc Int Conf Uncertainty Artificial Intell"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.2307\/2287970"},{"key":"ref91","article-title":"Deep Kalman filters","author":"krishnan","year":"2015","journal-title":"Proc Conf Neural Inf Process Syst Workshops"},{"key":"ref90","first-page":"3438","article-title":"Bayesian dark knowledge","author":"korattikara","year":"2015","journal-title":"Adv Neural Info Process Syst"},{"key":"ref98","article-title":"Reinforcement learning and control as probabilistic inference: Tutorial and review","author":"levine","year":"0","journal-title":"arXiv 1805 00909"},{"key":"ref99","first-page":"207","article-title":"Variational policy search via trajectory optimization","author":"levine","year":"2013","journal-title":"Proc 26th Int Conf Neural Inf Process Syst"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1214\/ss\/1177013621"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2011.10.004"},{"key":"ref82","first-page":"3402","article-title":"Kullback-Leibler proximal variational inference","author":"khan","year":"2015","journal-title":"Proc 28th Int Conf Neural Inf Process Syst"},{"key":"ref81","article-title":"Adversarial message passing for graphical models","author":"karaletsos","year":"2016","journal-title":"Proc 30th Conf Neural Inf Process Syst Workshops"},{"key":"ref84","first-page":"4743","article-title":"Improving variational autoencoders with inverse autoregressive flow","author":"kingma","year":"2016","journal-title":"Proc 30th Int Conf Neural Inf Process Syst"},{"key":"ref83","first-page":"270","article-title":"Fast variational inference for Gaussian process models through KL-correction","author":"king","year":"2006","journal-title":"Proc 17th Eur Conf Mach Learn"},{"key":"ref80","first-page":"220","article-title":"Second order approximations for probability models","author":"kappen","year":"2001","journal-title":"Proc 13th Int Conf Neural Inf Process Syst"},{"key":"ref89","article-title":"Stochastic gradient variational Bayes for gamma approximating distributions","author":"knowles","year":"2015","journal-title":"ArXiv"},{"key":"ref85","article-title":"Auto-encoding variational Bayes","author":"kingma","year":"2014","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref86","article-title":"Stochastic gradient VB and the variational auto-encoder","author":"kingma","year":"2014","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref87","article-title":"Adam: A method for stochastic optimization","author":"kingma","year":"2015","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref88","first-page":"1701","article-title":"Non-conjugate variational message passing for multinomial and binary regression","author":"knowles","year":"2011","journal-title":"Proc 24th Int Conf Neural Inf Process Syst"},{"key":"ref200","article-title":"Edward: A library for probabilistic modeling, inference, and criticism","author":"tran","year":"2016","journal-title":"arXiv 1610 09787"},{"key":"ref101","first-page":"2323","article-title":"Stochastic expectation propagation","author":"li","year":"2015","journal-title":"Proc 28th Int Conf Neural Inf Process Syst"},{"key":"ref100","article-title":"Approximate inference: New visions","author":"li","year":"2018"},{"key":"ref209","first-page":"752","article-title":"Online variational inference for the hierarchical dirichlet process","author":"wang","year":"2011","journal-title":"Proc 14th Int Conf Artif Intell Statist"},{"key":"ref203","first-page":"2627","article-title":"REBAR: Low-variance, unbiased gradient estimates for discrete latent variable models","author":"tucker","year":"2017","journal-title":"Proc 31st Int Conf Neural Inf Process Syst"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.2005.850091"},{"key":"ref201","article-title":"The Variational Gaussian Process","volume":"1050","author":"tran","year":"2016","journal-title":"Stat"},{"key":"ref202","article-title":"Hierarchical implicit models and likelihood-free variational inference","author":"tran","year":"0","journal-title":"arXiv 1702 08896"},{"key":"ref207","first-page":"1005","article-title":"Variational inference in non-conjugate models","volume":"14","author":"wang","year":"2013","journal-title":"Journal of Machine Learning Research"},{"key":"ref208","first-page":"181","article-title":"Variance reduction for stochastic gradient optimization","author":"wang","year":"2013","journal-title":"Proc 26th Int Conf Neural Inf Process Syst"},{"key":"ref205","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1561\/2200000001","article-title":"Graphical models, exponential families, and variational inference","volume":"1","author":"wainwright","year":"2008","journal-title":"Foundations & Trends in Mach Learn"},{"key":"ref206","first-page":"1903","article-title":"Simultaneous image classification and annotation","author":"wang","year":"2009","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref211","first-page":"3684","article-title":"Variational policy for guiding point processes","author":"wang","year":"2017","journal-title":"Proc 34th Int Conf Mach Learn"},{"key":"ref210","article-title":"Learning to draw samples: With application to amortized MLE for generative adversarial learning","author":"wang","year":"2016","journal-title":"arXiv 1611 01722"},{"key":"ref212","first-page":"3646","article-title":"Robust Probabilistic Modeling with Bayesian Data Reweighting","author":"wang","year":"2017","journal-title":"Proc 34th Int Conf Mach Learn"},{"key":"ref213","first-page":"1","article-title":"Frequentist consistency of variational bayes","author":"wang","year":"2018","journal-title":"JASA"},{"key":"ref214","first-page":"681","article-title":"Bayesian learning via stochastic gradient langevin dynamics","author":"welling","year":"2011","journal-title":"Proc 28th Int Conf Mach Learn"},{"key":"ref215","doi-asserted-by":"publisher","DOI":"10.1023\/A:1022672621406"},{"key":"ref216","first-page":"661","article-title":"Variational message passing","volume":"6","author":"winn","year":"2005","journal-title":"Journal of Machine Learning Research"},{"key":"ref217","first-page":"5660","article-title":"Semi-implicit variational inference","author":"yin","year":"2018","journal-title":"Proc 35th Int Conf Mach Learn"},{"key":"ref218","article-title":"ADADELTA: An adaptive learning rate method","author":"zeiler","year":"2012","journal-title":"arXiv 1212 5701"},{"key":"ref219","doi-asserted-by":"publisher","DOI":"10.1145\/2187836.2187955"},{"key":"ref220","article-title":"Structured representation using latent variable models","author":"zhang","year":"2016"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2013.41"},{"key":"ref221","first-page":"5079","article-title":"Perturbative black box variational inference","author":"zhang","year":"2017","journal-title":"Proc 31st Int Conf Neural Inf Process Syst"},{"key":"ref229","article-title":"Information geometric measurements of generalisation","author":"zhu","year":"1995"},{"key":"ref228","article-title":"Online spike-and-slab inference with stochastic expectation propagation","author":"zhe","year":"2016","journal-title":"Proc 30th Conf Neural Inf Process Syst Workshops"},{"key":"ref227","article-title":"Towards deeper understanding of variational autoencoding models","author":"zhao","year":"2017","journal-title":"CoRR"},{"key":"ref226","first-page":"1","article-title":"Stochastic optimization with importance sampling for regularized loss minimization","author":"zhao","year":"2015","journal-title":"Proceedings of the 32nd Intl Conf on Machine Learning"},{"key":"ref225","article-title":"Accelerating minibatch stochastic gradient descent using stratified sampling","author":"zhao","year":"2014","journal-title":"arXiv 1405 3080"},{"key":"ref224","article-title":"Active mini-batch sampling using repulsive point processes","author":"zhang","year":"0","journal-title":"arXiv 1804 02772"},{"key":"ref223","article-title":"Determinantal point processes for mini-batch diversification","author":"zhang","year":"2017","journal-title":"Proc Int Conf Uncertainty Artif Intell"},{"key":"ref127","first-page":"362","article-title":"Expectation propagation for approximate Bayesian inference","author":"minka","year":"2001","journal-title":"Proc 17th Int Conf Uncertainty Artif Intell"},{"key":"ref126","article-title":"Infer.NET 2.6","author":"minka","year":"2014"},{"key":"ref125","article-title":"Power EP","author":"minka","year":"2004"},{"key":"ref124","first-page":"2420","article-title":"Variational boosting: Iteratively refining posterior approximations","author":"miller","year":"2017","journal-title":"Proc 34th Int Conf Mach Learn"},{"key":"ref129","article-title":"Learning in implicit generative models","author":"mohamed","year":"2016","journal-title":"arXiv 1610 03483"},{"key":"ref128","article-title":"Divergence measures and message passing","author":"minka","year":"2005"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.2307\/1428011"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1162\/neco.2007.19.4.1112"},{"key":"ref134","article-title":"Stick-breaking variational autoencoders","author":"nalisnick","year":"2017","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref131","first-page":"467","article-title":"Loopy belief propagation for approximate inference: An empirical study","author":"murphy","year":"1999","journal-title":"Proc 15th Int Conf Uncertainty Artif Intell"},{"key":"ref132","first-page":"489","article-title":"Reparameterization gradients through acceptance-rejection sampling algorithms","author":"naesseth","year":"2017","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref136","article-title":"Probabilistic inference using Markov Chain Monte Carlo methods","author":"neal","year":"1993"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1109\/ICDMW.2007.33"},{"key":"ref138","article-title":"Embarrassingly parallel variational inference in nonconjugate models","author":"neiswanger","year":"2015","journal-title":"arXiv 1510 04163"},{"key":"ref137","volume":"118","author":"neal","year":"2012","journal-title":"Bayesian learning for neural networks"},{"key":"ref139","article-title":"Debiasing evidence approximations: On importance-weighted autoencoders and jackknife variational inference","author":"nowozin","year":"2018","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1111\/rssb.12185"},{"key":"ref141","article-title":"Perturbation theory for variational inference","author":"opper","year":"2015","journal-title":"Proc Conf Neural Inf Process Syst Workshops"},{"key":"ref142","first-page":"2857","article-title":"Perturbative corrections for approximate inference in gaussian latent variable models","volume":"14","author":"opper","year":"2013","journal-title":"Journal of Machine Learning Research"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.7551\/mitpress\/1100.001.0001"},{"key":"ref2","article-title":"Deep variational information bottleneck","author":"alemi","year":"2017","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref144","first-page":"225","article-title":"A mean field algorithm for Bayes learning in large feed-forward neural networks","author":"opper","year":"1996","journal-title":"Proc 9th Int Conf Neural Inf Process"},{"key":"ref1","first-page":"123","article-title":"Bayesian posterior sampling via stochastic gradient fisher scoring","author":"ahn","year":"2012","journal-title":"Proc 29th Int Conf Mach Learn"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevLett.86.3695"},{"key":"ref109","first-page":"2378","article-title":"Stein variational gradient descent: A general purpose Bayesian inference algorithm","author":"liu","year":"2016","journal-title":"Proc 30th Int Conf Neural Inf Process Syst"},{"key":"ref108","first-page":"276","article-title":"A kernelized stein discrepancy for goodness-of-fit tests","author":"liu","year":"2016","journal-title":"Proc 33rd Int Conf Mach Learn"},{"key":"ref107","article-title":"Two methods for wild variational inference","author":"liu","year":"2016","journal-title":"arXiv 1612 00081"},{"key":"ref106","article-title":"Variational message passing with structured inference networks","author":"lin","year":"2018","journal-title":"arXiv 1803 05589"},{"key":"ref105","article-title":"Approximate inference with amortised MCMC","author":"li","year":"2017","journal-title":"arXiv 1702 08343"},{"key":"ref104","first-page":"1511","article-title":"Black-box alpha divergence minimization","author":"li","year":"2016","journal-title":"Proc 33rd Int Conf Mach Learn"},{"key":"ref103","first-page":"1081","article-title":"R&#x00E9;nyi divergence variational inference","author":"li","year":"2016","journal-title":"Proc 30th Int Conf Neural Inf Process Syst"},{"key":"ref102","article-title":"Wild variational approximations","author":"li","year":"2016","journal-title":"Proc Conf Neural Inf Process Syst Workshops"},{"key":"ref111","article-title":"The concrete distribution: A continuous relaxation of discrete random variables","author":"maddison","year":"2017","journal-title":"ICLRE"},{"key":"ref112","first-page":"2438","article-title":"Smoothed Gradients for stochastic variational inference","author":"mandt","year":"2014","journal-title":"Proc 27th Int Conf Neural Inf Process Syst"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1201\/9781315366951"},{"key":"ref10","article-title":"Coupling adaptive batch sizes with learning rates","author":"balles","year":"2017","journal-title":"Proc Int Conf Uncertainty Artif Intell"},{"key":"ref11","first-page":"380","article-title":"Dynamic word embeddings","author":"bamler","year":"2017","journal-title":"Proc 34th Int Conf Mach Learn"},{"key":"ref12","article-title":"Structured black box variational inference for latent time series models","author":"bamler","year":"2017","journal-title":"Proc Int'l Conf Machine Learning Workshop"},{"key":"ref13","first-page":"201","article-title":"The IM algorithm: A variational approach to information maximization","author":"barber","year":"2003","journal-title":"Proc 16th Int Conf Neural Inf Process Syst"},{"key":"ref14","author":"bishop","year":"2006","journal-title":"Pattern Recognition and Machine Learning"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1080\/01621459.2017.1285773"},{"key":"ref16","first-page":"147","article-title":"Correlated topic models","author":"blei","year":"2006","journal-title":"Proc 18th Int Conf Neural Inf Process Syst"},{"key":"ref118","first-page":"2391","article-title":"Adversarial variational bayes: Unifying variational autoencoders and generative adversarial networks","author":"mescheder","year":"2017","journal-title":"Proc 34th Int Conf Mach Learn"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143859"},{"key":"ref117","first-page":"1153","article-title":"The population posterior and Bayesian modeling on streams","author":"mcinerney","year":"2015","journal-title":"Proc 28th Int Conf Neural Inf Process Syst"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-7908-2604-3_16"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/K16-1002"},{"key":"ref119","first-page":"1826","article-title":"The numerics of GANs","author":"mescheder","year":"2017","journal-title":"Proc 31st Int Conf Neural Inf Process Syst"},{"key":"ref114","first-page":"4873","article-title":"Stochastic gradient descent as approximate Bayesian inference","volume":"18","author":"mandt","year":"2017","journal-title":"Journal of Machine Learning Research"},{"key":"ref113","first-page":"354","article-title":"A variational analysis of stochastic gradient algorithms","author":"mandt","year":"2016","journal-title":"Proc 33rd Int Conf Mach Learn"},{"key":"ref116","first-page":"3403","article-title":"Iterative amortized inference","author":"marino","year":"2018","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref115","first-page":"704","article-title":"Variational Tempering","author":"mandt","year":"2016","journal-title":"Proc 19th Int Conf Artif Intell"},{"key":"ref120","article-title":"Spin glass theory and beyond","volume":"9","author":"m\u00e9zard","year":"1990"},{"key":"ref121","article-title":"Fast and scalable Bayesian deep learning by weight-perturbation in adam","author":"khan","year":"0","journal-title":"arXiv 1806 04854"},{"key":"ref122","first-page":"1727","article-title":"Neural variational inference for text processing","author":"miao","year":"2016","journal-title":"Proc 33rd Int Conf Mach Learn"},{"key":"ref123","first-page":"3708","article-title":"Reducing reparameterization gradient variance","author":"miller","year":"2017","journal-title":"Proc 31st Int Conf Neural Inf Process Syst"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/8752185\/08588399.pdf?arnumber=8588399","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,1,26]],"date-time":"2022-01-26T02:10:56Z","timestamp":1643163056000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8588399\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,8,1]]},"references-count":229,"journal-issue":{"issue":"8"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2018.2889774","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,8,1]]}}}