{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,11]],"date-time":"2026-02-11T22:00:01Z","timestamp":1770847201018,"version":"3.50.1"},"reference-count":83,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2023,3,1]],"date-time":"2023-03-01T00:00:00Z","timestamp":1677628800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,3,1]],"date-time":"2023-03-01T00:00:00Z","timestamp":1677628800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,3,1]],"date-time":"2023-03-01T00:00:00Z","timestamp":1677628800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2020YFA0713900"],"award-info":[{"award-number":["2020YFA0713900"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62076196"],"award-info":[{"award-number":["62076196"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61721002"],"award-info":[{"award-number":["61721002"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U1811461"],"award-info":[{"award-number":["U1811461"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100006469","name":"Fundo para o Desenvolvimento das Ci\u00eancias e da Tecnologia","doi-asserted-by":"publisher","award":["061\/2020\/A2"],"award-info":[{"award-number":["061\/2020\/A2"]}],"id":[{"id":"10.13039\/501100006469","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Major Key Project of PCL","award":["PCL2021A12"],"award-info":[{"award-number":["PCL2021A12"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2023,3,1]]},"DOI":"10.1109\/tpami.2022.3184315","type":"journal-article","created":{"date-parts":[[2022,6,20]],"date-time":"2022-06-20T16:33:41Z","timestamp":1655742821000},"page":"3505-3521","source":"Crossref","is-referenced-by-count":10,"title":["MLR-SNet: Transferable LR Schedules for Heterogeneous Tasks"],"prefix":"10.1109","volume":"45","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-9968-3048","authenticated-orcid":false,"given":"Jun","family":"Shu","sequence":"first","affiliation":[{"name":"School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi&#x0027;an Jiaotong University, Xi&#x0027;an, Shaanxi, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yanwen","family":"Zhu","sequence":"additional","affiliation":[{"name":"School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi&#x0027;an Jiaotong University, Xi&#x0027;an, Shaanxi, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qian","family":"Zhao","sequence":"additional","affiliation":[{"name":"School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi&#x0027;an Jiaotong University, Xi&#x0027;an, Shaanxi, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1294-8283","authenticated-orcid":false,"given":"Deyu","family":"Meng","sequence":"additional","affiliation":[{"name":"School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi&#x0027;an Jiaotong University, Xi&#x0027;an, Shaanxi, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zongben","family":"Xu","sequence":"additional","affiliation":[{"name":"School of Mathematics and Statistics and Ministry of Education Key Lab of Intelligent Networks and Network Security, Xi&#x0027;an Jiaotong University, Xi&#x0027;an, Shaanxi, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Learning an explicit hyperparameter prediction policy conditioned on tasks","author":"Shu","year":"2021"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3271451"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177729586"},{"key":"ref4","first-page":"2121","article-title":"Adaptive subgradient methods for online learning and stochastic optimization","volume":"12","author":"Duchi","year":"2011","journal-title":"J. Mach. Learn. Res."},{"key":"ref5","article-title":"ADADELTA: An adaptive learning rate method","author":"Zeiler","year":"2012"},{"key":"ref6","first-page":"26","article-title":"Lecture 6.5-rmsprop: Divide the gradient by a running average of its recent magnitude","volume":"4","author":"Tieleman","year":"2012","journal-title":"Neural Netw. Mach. Learn."},{"key":"ref7","first-page":"1","article-title":"Adam: A method for stochastic optimization","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Kingma"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1145\/3446776"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.1.1"},{"key":"ref10","first-page":"1","article-title":"On large-batch training for deep learning: Generalization gap and sharp minima","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Keskar"},{"key":"ref11","first-page":"1019","article-title":"Sharp minima can generalize for deep nets","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Dinh"},{"key":"ref12","first-page":"8289","article-title":"How SGD selects the global minima in over-parameterized learning: A dynamical stability perspective","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Wu"},{"key":"ref13","first-page":"876","article-title":"Averaging weights leads to wider optima and better generalization","volume-title":"Proc. Conf. Uncertainty Artif. Intell.","author":"Izmailov"},{"key":"ref14","first-page":"6391","article-title":"Visualizing the loss landscape of neural nets","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Li"},{"key":"ref15","article-title":"Three factors influencing minima in SGD","author":"Jastrzebski","year":"2017"},{"key":"ref16","first-page":"1143","article-title":"Control batch size and learning rate to generalize well: Theoretical and empirical evidence","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"He"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-35289-8_26"},{"key":"ref18","first-page":"343","article-title":"No more pesky learning rates","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Schaul"},{"key":"ref19","first-page":"3440","article-title":"Step size matters in deep learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Nar"},{"key":"ref20","article-title":"Stochastic gradient descent with large learning rate","author":"Liu","year":"2020"},{"key":"ref21","first-page":"5200","article-title":"SGD: General analysis and improved rates","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Gower"},{"key":"ref22","first-page":"1","article-title":"SGDR: Stochastic gradient descent with warm restarts","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Loshchilov"},{"key":"ref23","first-page":"8026","article-title":"Pytorch: An imperative style, high-performance deep learning library","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Paszke"},{"key":"ref24","article-title":"The step decay schedule: A near optimal, geometrically decaying learning rate procedure for least squares","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ge"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-023-02003-w"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-019-01374-3"},{"key":"ref27","first-page":"6471","article-title":"First-order methods almost always avoid saddle points: The case of vanishing step-sizes","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Panageas"},{"key":"ref28","first-page":"6434","article-title":"L4: Practical loss-based stepsize adaptation for deep learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Rolinek"},{"key":"ref29","first-page":"1","article-title":"Deep Frank-Wolfe for neural network optimization","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Berrada"},{"key":"ref30","article-title":"Painless stochastic gradient: Interpolation, line-search, and convergence rates","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Vaswani"},{"key":"ref31","volume-title":"Numerical Optimization","author":"Nocedal","year":"2006"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1037\/h0093534"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1017\/S0140525X16001837"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1992.4.1.131"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.1991.155621"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-44668-0_13"},{"key":"ref38","first-page":"3988","article-title":"Learning to learn by gradient descent by gradient descent","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Andrychowicz"},{"key":"ref39","first-page":"748","article-title":"Learning to learn without gradient descent by gradient descent","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Chen"},{"key":"ref40","first-page":"3751","article-title":"Learned optimizers that scale and generalize","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wichrowska"},{"key":"ref41","article-title":"Learning to optimize neural nets","author":"Li"},{"key":"ref42","first-page":"1","article-title":"Optimization as a model for few-shot learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Ravi"},{"key":"ref43","first-page":"2247","article-title":"Learning gradient descent: Better generalization and longer horizons","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Lv"},{"key":"ref44","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Finn"},{"key":"ref45","article-title":"Meta-SGD: Learning to learn quickly for few-shot learning","author":"Li","year":"2017"},{"key":"ref46","article-title":"Meta-curvature","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Park"},{"key":"ref47","first-page":"5405","article-title":"Evolved policy gradients","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Houthooft"},{"key":"ref48","first-page":"4374","article-title":"Learning to optimize combinatorial functions","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Rosenfeld"},{"key":"ref49","first-page":"4150","article-title":"Meta-learning MCMC proposals","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Wang"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-05318-5"},{"key":"ref51","first-page":"281","article-title":"Random search for hyper-parameter optimization","volume":"13","author":"Bergstra","year":"2012","journal-title":"J. Mach. Learn. Res."},{"key":"ref52","first-page":"2951","article-title":"Practical Bayesian optimization of machine learning algorithms","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Snoek"},{"key":"ref53","first-page":"1165","article-title":"Forward and reverse gradient-based hyperparameter optimization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Franceschi"},{"key":"ref54","article-title":"Learning adaptive loss for robust learning with noisy labels","author":"Shu","year":"2020"},{"key":"ref55","article-title":"Meta transition adaptation for robust deep learning with noisy labels","author":"Shu","year":"2020"},{"key":"ref56","first-page":"1","article-title":"Online learning rate adaptation with hypergradient descent","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Baydin"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58517-4_24"},{"key":"ref58","first-page":"1","article-title":"Understanding short-horizon bias in stochastic meta-optimization","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Wu"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2009.191"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1017\/9781139061773"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1016\/0041-5553(64)90137-5"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1137\/S1052623495294797"},{"key":"ref63","article-title":"Small sample learning in big data era","author":"Shu","year":"2018"},{"key":"ref64","first-page":"1917","article-title":"Meta-weight-net: Learning an explicit mapping for sample weighting","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Shu"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.5244\/C.30.87"},{"key":"ref66","first-page":"4151","article-title":"The marginal value of adaptive gradient methods in machine learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Wilson"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.21236\/ADA273556"},{"key":"ref69","first-page":"1","article-title":"Adaptive gradient methods with dynamic bound of learning rate","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Luo"},{"key":"ref70","first-page":"2164","article-title":"Norm matters: Efficient and accurate normalization schemes in deep networks","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Hoffer"},{"key":"ref71","first-page":"1","article-title":"Three mechanisms of weight decay regularization","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Zhang"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.2118\/18761-MS"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_8"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00474"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00907"},{"key":"ref76","first-page":"6105","article-title":"EfficientNet: Rethinking model scaling for convolutional neural networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Tan"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref78","first-page":"1","article-title":"Benchmarking neural network robustness to common corruptions and perturbations","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Hendrycks"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46128-1_50"},{"key":"ref80","first-page":"314","article-title":"Stochastic variance reduction for nonconvex optimization","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Reddi"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1137\/16M1080173"},{"issue":"4","key":"ref82","first-page":"643","article-title":"Gradient methods for minimizing functionals","volume":"3","author":"Polyak","year":"1963","journal-title":"Zhurnal Vychislitel\u2019noi Matematiki i Matematicheskoi Fiziki"},{"key":"ref83","first-page":"87","article-title":"A topological property of real analytic subsets","volume":"117","author":"Lojasiewicz","year":"1963","journal-title":"Coll. du CNRS, Les \u00c9quations aux D\u00e9riv\u00e9es Partielles"},{"key":"ref84","first-page":"1195","article-title":"Fast and faster convergence of SGD for over-parameterized models and an accelerated perceptron","volume-title":"Proc. 22nd Int. Conf. Artif. Intell. Statist.","author":"Vaswani"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/10036240\/09801599.pdf?arnumber=9801599","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,11]],"date-time":"2026-02-11T20:55:51Z","timestamp":1770843351000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9801599\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,3,1]]},"references-count":83,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2022.3184315","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,3,1]]}}}