{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,4,5]],"date-time":"2025-04-05T04:21:41Z","timestamp":1743826901331,"version":"3.40.3"},"reference-count":49,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"10","license":[{"start":{"date-parts":[[2022,10,1]],"date-time":"2022-10-01T00:00:00Z","timestamp":1664582400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2022,10,1]],"date-time":"2022-10-01T00:00:00Z","timestamp":1664582400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2022,10,1]],"date-time":"2022-10-01T00:00:00Z","timestamp":1664582400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2018AAA0100400"],"award-info":[{"award-number":["2018AAA0100400"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61876090","61936005"],"award-info":[{"award-number":["61876090","61936005"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Key-Area Research and Development Program of Guangdong Province","award":["2019B121204008"],"award-info":[{"award-number":["2019B121204008"]}]},{"name":"NSF China","award":["61625301","61731018"],"award-info":[{"award-number":["61625301","61731018"]}]},{"name":"PKU-Baidu Fund","award":["2020BD006"],"award-info":[{"award-number":["2020BD006"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2022,10,1]]},"DOI":"10.1109\/tpami.2021.3087328","type":"journal-article","created":{"date-parts":[[2021,6,9]],"date-time":"2021-06-09T15:52:57Z","timestamp":1623253977000},"page":"5933-5946","source":"Crossref","is-referenced-by-count":3,"title":["A Hybrid Stochastic-Deterministic Minibatch Proximal Gradient Method for Efficient Optimization and Generalization"],"prefix":"10.1109","volume":"44","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-3400-8943","authenticated-orcid":false,"given":"Pan","family":"Zhou","sequence":"first","affiliation":[{"name":"Salesforce, Sea AI Lab of Sea Group, Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7151-8806","authenticated-orcid":false,"given":"Xiao-Tong","family":"Yuan","sequence":"additional","affiliation":[{"name":"School of Computer and Software, Nanjing University of Information Science and Technology, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1493-7569","authenticated-orcid":false,"given":"Zhouchen","family":"Lin","sequence":"additional","affiliation":[{"name":"Key Lab. of Machine Perception (MoE), School of EECS, Peking University, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Steven C.H.","family":"Hoi","sequence":"additional","affiliation":[{"name":"Salesforce Research, Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"volume-title":"Handbook of Convex Optimization Methods in Imaging Science","year":"2017","author":"Monga","key":"ref1"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2008.79"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2013.57"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2019.2954874"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.419"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1017\/cbo9780511804458"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2010.936020"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1201\/9781315366920"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1111\/j.2517-6161.1996.tb02080.x"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4419-8853-9"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1201\/b18401"},{"article-title":"Machine learning in computational finance","year":"2005","author":"Boyarshinov","key":"ref12"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-012-0573-4"},{"key":"ref14","first-page":"536","article-title":"M\u00e9thode g\u00e9n\u00e9rale pour la r\u00e9solution des syst\u00e8mes d\u00e9quations simultan\u00e9es","volume":"25","author":"Cauchy","year":"1847","journal-title":"Comptesrendus des s\u00e9ances de l\u2019Acad\u00e9mie des sciences de Paris"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177729586"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1561\/2200000018"},{"key":"ref17","first-page":"1646","article-title":"SAGA: A fast incremental gradient method with support for non-strongly convex composite objectives","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Defazio"},{"key":"ref18","first-page":"315","article-title":"Accelerating stochastic gradient descent using predictive variance reduction","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Johnson"},{"key":"ref19","first-page":"3384","article-title":"A universal catalyst for first-order optimization","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Lin"},{"key":"ref20","first-page":"148","article-title":"Less than a single pass: Stochastically controlled stochastic gradient","volume-title":"Proc. Artif. Intell. Statist.","author":"Lei"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/3055399.3055448"},{"key":"ref22","first-page":"10462","article-title":"A unified variance-reduced accelerated gradient method for convex optimization","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Lan"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.7551\/mitpress\/8996.003.0015"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/0-387-34239-7"},{"key":"ref25","first-page":"113","article-title":"Stochastic convex optimization","volume-title":"Proc. Conf. Learn. Theory","author":"Shalev-Shwartz"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9781107298019"},{"article-title":"Making gradient descent optimal for strongly convex stochastic optimization","year":"2011","author":"Shamir","key":"ref27"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-014-0839-0"},{"key":"ref29","first-page":"3059","article-title":"An accelerated proximal coordinate gradient method","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Lin"},{"key":"ref30","first-page":"353","article-title":"Stochastic primal-dual coordinate method for regularized empirical risk minimization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zhang"},{"key":"ref31","first-page":"195","article-title":"Accelerated stochastic gradient descent for minimizing finite sums","volume-title":"Proc. Artif. Intell. Statist.","author":"Nitanda"},{"issue":"1","key":"ref32","first-page":"3520","article-title":"Harder, better, faster, stronger convergence rates for least-squares regression","volume":"18","author":"Dieuleveut","year":"2017","journal-title":"J. Mach. Learn. Res."},{"key":"ref33","first-page":"773","article-title":"Non-strongly-convex smooth stochastic approximation with convergence rate O (1\/n)","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Bach"},{"key":"ref34","first-page":"11556","article-title":"Hybrid stochastic-deterministic minibatch proximal gradient: Less-than-single-pass optimization with nearly optimal generalization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zhou"},{"issue":"8","key":"ref35","first-page":"12","article-title":"Stochastic gradient learning in neural networks","volume-title":"Proc. Neuro-N\u0131mes","volume":"91","author":"Bottou"},{"article-title":"Asynchronous accelerated proximal stochastic gradient for strongly convex distributed finite sums","year":"2019","author":"Hendrikx","key":"ref36"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.23919\/ACC.2019.8814680"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1137\/110830629"},{"key":"ref39","first-page":"1","article-title":"Efficient stochastic gradient hard thresholding","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Zhou"},{"key":"ref40","first-page":"1234","article-title":"New insight into hybrid stochastic gradient descent: Beyond with-replacement sampling and convexity","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Zhou"},{"key":"ref41","first-page":"4062","article-title":"Adaptive newton method for empirical risk minimization to statistical accuracy","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Mokhtari"},{"key":"ref42","first-page":"2060","article-title":"First-order adaptive sample size methods to reduce complexity of empirical risk minimization","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Mokhtari"},{"key":"ref43","first-page":"1000","article-title":"Communication-efficient distributed optimization using an approximate newton-type method","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Shamir"},{"key":"ref44","first-page":"1225","article-title":"Train faster, generalize better: Stability of stochastic gradient descent","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Hardt"},{"key":"ref45","first-page":"5960","article-title":"Understanding generalization and optimization performance of deep CNNs","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Zhou"},{"key":"ref46","first-page":"1","article-title":"Empirical risk landscape analysis for understanding deep neural networks","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhou"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1162\/153244302760200704"},{"key":"ref48","first-page":"1270","article-title":"High probability generalization bounds for uniformly stable algorithms with nearly optimal rate","volume-title":"Proc. Conf. Learn. Theory","author":"Feldman"},{"key":"ref49","first-page":"1","article-title":"On convergence of distributed approximate Newton methods: Globalization, sharper bounds and beyond","author":"Yuan","year":"2020","journal-title":"J. Mach. Learn. Res."}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/9893034\/09448388.pdf?arnumber=9448388","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,4]],"date-time":"2025-04-04T19:44:05Z","timestamp":1743795845000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9448388\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,1]]},"references-count":49,"journal-issue":{"issue":"10"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2021.3087328","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"type":"print","value":"0162-8828"},{"type":"electronic","value":"2160-9292"},{"type":"electronic","value":"1939-3539"}],"subject":[],"published":{"date-parts":[[2022,10,1]]}}}