{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,12]],"date-time":"2026-08-12T22:06:26Z","timestamp":1786572386352,"version":"3.56.0"},"reference-count":79,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"1","license":[{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61621005"],"award-info":[{"award-number":["61621005"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["91438201"],"award-info":[{"award-number":["91438201"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["91438103"],"award-info":[{"award-number":["91438103"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61876220"],"award-info":[{"award-number":["61876220"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61836009"],"award-info":[{"award-number":["61836009"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U1701267"],"award-info":[{"award-number":["U1701267"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61871310"],"award-info":[{"award-number":["61871310"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61573267"],"award-info":[{"award-number":["61573267"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61502369"],"award-info":[{"award-number":["61502369"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61876221"],"award-info":[{"award-number":["61876221"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61473215"],"award-info":[{"award-number":["61473215"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Cheung Kong Scholars and Innovative Research Team in University","award":["IRT_15R53"],"award-info":[{"award-number":["IRT_15R53"]}]},{"name":"University Research and Teaching Programs","award":["B07048"],"award-info":[{"award-number":["B07048"]}]},{"DOI":"10.13039\/501100005320","name":"Xidian University","doi-asserted-by":"publisher","award":["10251180018"],"award-info":[{"award-number":["10251180018"]}],"id":[{"id":"10.13039\/501100005320","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Hong Kong RGC","award":["CUHK 14206715"],"award-info":[{"award-number":["CUHK 14206715"]}]},{"name":"Hong Kong RGC","award":["14222816"],"award-info":[{"award-number":["14222816"]}]},{"name":"ARC","award":["FT130100746"],"award-info":[{"award-number":["FT130100746"]}]},{"name":"ARC","award":["DP180100106"],"award-info":[{"award-number":["DP180100106"]}]},{"name":"ARC","award":["LP150100671"],"award-info":[{"award-number":["LP150100671"]}]},{"name":"JiangsuSF","award":["BK20160658"],"award-info":[{"award-number":["BK20160658"]}]},{"DOI":"10.13039\/501100000923","name":"Australian Research Council","doi-asserted-by":"publisher","award":["FL-170100117"],"award-info":[{"award-number":["FL-170100117"]}],"id":[{"id":"10.13039\/501100000923","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000923","name":"Australian Research Council","doi-asserted-by":"publisher","award":["DP-180103424"],"award-info":[{"award-number":["DP-180103424"]}],"id":[{"id":"10.13039\/501100000923","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000923","name":"Australian Research Council","doi-asserted-by":"publisher","award":["IH180100002"],"award-info":[{"award-number":["IH180100002"]}],"id":[{"id":"10.13039\/501100000923","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Knowl. Data Eng."],"published-print":{"date-parts":[[2020,1,1]]},"DOI":"10.1109\/tkde.2018.2878765","type":"journal-article","created":{"date-parts":[[2018,10,30]],"date-time":"2018-10-30T19:28:37Z","timestamp":1540927717000},"page":"188-202","source":"Crossref","is-referenced-by-count":54,"title":["VR-SGD: A Simple Stochastic Variance Reduction Method for Machine Learning"],"prefix":"10.1109","volume":"32","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-1040-352X","authenticated-orcid":false,"given":"Fanhua","family":"Shang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kaiwen","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8475-2749","authenticated-orcid":false,"given":"Hongying","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"James","family":"Cheng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ivor W.","family":"Tsang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5138-3182","authenticated-orcid":false,"given":"Lijun","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7225-5449","authenticated-orcid":false,"given":"Dacheng","family":"Tao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3354-9617","authenticated-orcid":false,"given":"Licheng","family":"Jiao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref73","first-page":"46","article-title":"Without-replacement sampling for stochastic gradient methods","author":"shamir","year":"2016","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-015-0864-7"},{"key":"ref71","first-page":"1","article-title":"Stochastic optimization with importance sampling for regularized loss minimization","author":"zhao","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref70","first-page":"1208","article-title":"Homotopy smoothing for non-smooth problems with lower complexity than ${O}(1\/\\epsilon)$O(1\/?)","author":"xu","year":"2016","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref76","first-page":"1","article-title":"Lazy sparse stochastic gradient descent for regularized multinomial logistic regression","author":"carpenter","year":"2008"},{"key":"ref77","first-page":"777","article-title":"Sparse online learning via truncated gradient","volume":"10","author":"langford","year":"2009","journal-title":"J Mach Learn Res"},{"key":"ref74","doi-asserted-by":"crossref","first-page":"993","DOI":"10.1080\/10556788.2017.1298596","article-title":"Semi-stochastic gradient descent methods","volume":"32","author":"kone?n\u00fd","year":"2017","journal-title":"Optimization Methods and Software"},{"key":"ref39","first-page":"1574","article-title":"Stochastic proximal gradient descent with acceleration techniques","author":"nitanda","year":"2014","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref75","first-page":"815","article-title":"ASVRG: Accelerated proximal SVRG","volume":"95","author":"shang","year":"2018","journal-title":"Mach Learn Res"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2015.2505682"},{"key":"ref78","first-page":"1","article-title":"A differential equation for modeling Nesterov's accelerated gradient method: Theory and insights","volume":"17","author":"su","year":"2016","journal-title":"J Mach Learn Res"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1137\/100806126"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-016-1030-6"},{"key":"ref32","first-page":"353","article-title":"Stochastic primal-dual coordinate method for regularized empirical risk minimization","author":"zhang","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref31","first-page":"1646","article-title":"SAGA: A fast incremental gradient method with support for non-strongly convex composite objectives","author":"defazio","year":"2014","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref30","first-page":"567","article-title":"Stochastic dual coordinate ascent methods for regularized loss minimization","volume":"14","author":"shalev-shwartz","year":"2013","journal-title":"J Mach Learn Res"},{"key":"ref37","first-page":"980","article-title":"Linear convergence with condition number independent access of full gradients","author":"zhang","year":"2013","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref36","article-title":"Fast stochastic variance reduced gradient method with momentum acceleration for machine learning","author":"shang","year":"2017"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-014-0839-0"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1137\/140961791"},{"key":"ref60","first-page":"2629","article-title":"On variance reduction in stochastic gradient descent and its asynchronous variants","author":"reddi","year":"2015","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref62","first-page":"1","article-title":"Distributed stochastic variance reduced gradient methods by sampling extra data with replacement","volume":"18","author":"lee","year":"2017","journal-title":"J Mach Learn Res"},{"key":"ref61","first-page":"5336","article-title":"Can decentralized algorithms outperform centralized algorithms? A case study for decentralized parallel stochastic gradient descent","author":"lian","year":"2017","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref28","first-page":"449","article-title":"Making gradient descent optimal for strongly convex stochastic optimization","author":"rakhlin","year":"2012","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1561\/2200000006"},{"key":"ref27","doi-asserted-by":"crossref","first-page":"354","DOI":"10.1038\/nature24270","article-title":"Mastering the game of go without human knowledge","volume":"550","author":"silver","year":"2017","journal-title":"Nature"},{"key":"ref64","first-page":"797","article-title":"Escaping from saddle points&#x2014;Online stochastic gradient for tensor decomposition","author":"ge","year":"2015","journal-title":"Proc Conf Learn Theory"},{"key":"ref65","article-title":"Adding gradient noise improves learning for very deep networks","author":"neelakantan","year":"2015"},{"key":"ref29","first-page":"2672","article-title":"A stochastic gradient method with an exponential convergence rate for finite training sets","author":"roux","year":"2012","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref66","first-page":"658","article-title":"From averaging to acceleration, there is only a step-size","author":"flammarion","year":"2015","journal-title":"Proc Conf Learn Theory"},{"key":"ref67","first-page":"685","article-title":"Barzilai-Borwein step size for stochastic gradient descent","author":"tan","year":"2016","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref68","first-page":"1606","article-title":"Optimal black-box reductions between optimization objectives","author":"allen-zhu","year":"2016","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref2","first-page":"1097","article-title":"ImageNet classification with deep convolutional neural networks","author":"krizhevsky","year":"2012","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-004-0552-5"},{"key":"ref1","first-page":"315","article-title":"Accelerating stochastic gradient descent using predictive variance reduction","author":"johnson","year":"2013","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4419-8853-9"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1137\/080716542"},{"key":"ref21","article-title":"On accelerated proximal gradient methods for convex-concave optimization","author":"tseng","year":"2008"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/1015330.1015332"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177729586"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1561\/2200000050"},{"key":"ref25","first-page":"781","article-title":"Accelerated gradient methods for stochastic optimization and online learning","author":"hu","year":"2009","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref50","first-page":"5975","article-title":"A simple stochastic variance reduced algorithm with fast convergence rates","author":"zhou","year":"2018","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref51","first-page":"3639","article-title":"Tight complexity bounds for optimizing composite objectives","author":"woodworth","year":"2016","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1137\/16M1057000"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2016.7798553"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2866699"},{"key":"ref56","article-title":"Stochastically controlled stochastic gradient for the convex and non-convex composition problem","author":"liu","year":"2018"},{"key":"ref55","article-title":"Stochastic zeroth-order optimization via variance reduction method","author":"liu","year":"2018"},{"key":"ref54","first-page":"2345","article-title":"Nonconvex finite-sum optimization via SCSG methods","author":"lei","year":"2017","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref53","article-title":"Variance reduced methods for non-convex composition optimization","author":"liu","year":"2017"},{"key":"ref52","first-page":"676","article-title":"A simple practical accelerated method for finite sums","author":"defazio","year":"2016","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref10","first-page":"613","article-title":"Catalyst for gradient-based nonconvex optimization","author":"paquette","year":"2018","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461325"},{"key":"ref40","first-page":"3366","article-title":"A universal catalyst for first-order optimization","author":"lin","year":"2015","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref12","article-title":"Stochastic methods for composite optimization problems","author":"duchi","year":"2017"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1007\/s12532-013-0053-8"},{"key":"ref14","first-page":"3712","article-title":"A unified variance reduction-based framework for nonconvex low-rank matrix recovery","author":"wang","year":"2017","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref15","first-page":"819","article-title":"Non-uniform stochastic average gradient method for training conditional random fields","author":"schmidt","year":"2015","journal-title":"Proc Int Conf Artif Intell Statist"},{"key":"ref16","first-page":"98","article-title":"Doubly accelerated methods for faster CCA and generalized eigendecomposition","author":"allen-zhu","year":"2017","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref17","first-page":"144","article-title":"A stochastic PCA and SVD algorithm with an exponential convergence rate","author":"shamir","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref18","first-page":"2626","article-title":"Faster eigenvector computation via shift-and-invert preconditioning","author":"garber","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref19","first-page":"372","article-title":"A method of solving a convex programming problem with convergence rate ${O}(1\/k^2)$O(1\/k2)","volume":"27","author":"nesterov","year":"1983","journal-title":"Soviet Math Doklady"},{"key":"ref4","first-page":"699","article-title":"Variance reduction for faster non-convex optimization","author":"allen-zhu","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref3","first-page":"685","article-title":"Deep learning with elastic averaging SGD","author":"zhang","year":"2015","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref6","first-page":"2287","article-title":"Accelerated variance reduced stochastic ADMM","author":"liu","year":"2017","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"ref5","first-page":"314","article-title":"Stochastic variance reduction for nonconvex optimization","author":"reddi","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2578323"},{"key":"ref7","first-page":"917","article-title":"Nonconvex sparse learning via stochastic optimization with progressive variance reduction","author":"li","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref49","article-title":"Accelerated stochastic mirror descent algorithms for composite non-strongly convex optimization","author":"hien","year":"2017"},{"key":"ref9","article-title":"Linear convergence of SVRG in statistical estimation","author":"qu","year":"2017"},{"key":"ref46","first-page":"1263","article-title":"Variance-reduced and projection-free stochastic optimization","author":"hazan","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1002\/nav.3800030109"},{"key":"ref48","first-page":"1","article-title":"Katyusha: The first direct acceleration of stochastic gradient methods","volume":"18","author":"allen-zhu","year":"2018","journal-title":"J Mach Learn Res"},{"key":"ref47","first-page":"1027","article-title":"Guaranteed sufficient decrease for stochastic variance reduced gradient optimization","author":"shang","year":"2018","journal-title":"Proc 21st Int Conf Artif Intell Statist"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-017-1173-0"},{"key":"ref41","first-page":"2540","article-title":"Un-regularizing: Approximate proximal point and faster stochastic algorithms for empirical risk minimization","author":"frostig","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref44","first-page":"1080","article-title":"Improved SVRG for non-strongly-convex or sum-of-non-convex objectives","author":"allen-zhu","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref43","first-page":"2242","article-title":"Stop wasting my gradients: Practical SVRG","author":"babanezhad","year":"2015","journal-title":"Proc Int Conf Neural Inf Process"}],"container-title":["IEEE Transactions on Knowledge and Data Engineering"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/69\/8926561\/08515112.pdf?arnumber=8515112","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,4,27]],"date-time":"2022-04-27T14:41:50Z","timestamp":1651070510000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8515112\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,1,1]]},"references-count":79,"journal-issue":{"issue":"1"},"URL":"https:\/\/doi.org\/10.1109\/tkde.2018.2878765","relation":{},"ISSN":["1041-4347","1558-2191","2326-3865"],"issn-type":[{"value":"1041-4347","type":"print"},{"value":"1558-2191","type":"electronic"},{"value":"2326-3865","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,1,1]]}}}