{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,14]],"date-time":"2025-10-14T01:09:13Z","timestamp":1760404153185,"version":"3.37.3"},"reference-count":44,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2015,10,20]],"date-time":"2015-10-20T00:00:00Z","timestamp":1445299200000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2015,10,20]],"date-time":"2015-10-20T00:00:00Z","timestamp":1445299200000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["IIS-1463988"],"award-info":[{"award-number":["IIS-1463988"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Mach Learn"],"published-print":{"date-parts":[[2016,4]]},"DOI":"10.1007\/s10994-015-5536-6","type":"journal-article","created":{"date-parts":[[2015,10,20]],"date-time":"2015-10-20T19:39:48Z","timestamp":1445369988000},"page":"57-79","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["On Data Preconditioning for Regularized Loss Minimization"],"prefix":"10.1007","volume":"103","author":[{"given":"Tianbao","family":"Yang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rong","family":"Jin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shenghuo","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qihang","family":"Lin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2015,10,20]]},"reference":[{"key":"5536_CR1","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511624100","volume-title":"Iterative solution methods","author":"O Axelsson","year":"1994","unstructured":"Axelsson, O. (1994). Iterative solution methods. New York, NY: Cambridge University Press."},{"key":"5536_CR2","unstructured":"Bach, F. (2013). Sharp analysis of low-rank kernel matrix approximations. In COLT (pp. 185\u2013209)."},{"key":"5536_CR3","unstructured":"Bach, F., & Moulines, E. (2013). Non-strongly-convex smooth stochastic approximation with convergence rate o(1\/n). In NIPS (pp. 773\u2013781)."},{"key":"5536_CR4","unstructured":"Bertin-Mahieux, T., Ellis, D. P. W., Whitman, B., & Lamere, P. (2011). The million song dataset. In ISMIR (pp. 591\u2013596)."},{"key":"5536_CR5","unstructured":"Blackard, J. A. (1998). Comparison of neural networks and discriminant analysis in predicting forest cover types. Ph.D. thesis."},{"key":"5536_CR6","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511804441","volume-title":"Convex optimization","author":"S Boyd","year":"2004","unstructured":"Boyd, S., & Vandenberghe, L. (2004). Convex optimization. New York, NY: Cambridge University Press."},{"key":"5536_CR7","doi-asserted-by":"publisher","first-page":"977","DOI":"10.1137\/10079923X","volume":"21","author":"RH Byrd","year":"2011","unstructured":"Byrd, R. H., Chin, G. M., Neveitt, W., & Nocedal, J. (2011). On the use of stochastic hessian information in optimization methods for machine learning. SIAM Journal on Optimization, 21, 977\u2013995.","journal-title":"SIAM Journal on Optimization"},{"key":"5536_CR8","doi-asserted-by":"publisher","first-page":"969","DOI":"10.1088\/0266-5611\/23\/3\/008","volume":"23","author":"EJ Candes","year":"2007","unstructured":"Candes, E. J., & Romberg, J. (2007). Sparsity and incoherence in compressive sampling. Inverse Problems, 23, 969\u2013985.","journal-title":"Inverse Problems"},{"key":"5536_CR9","first-page":"2121","volume":"12","author":"J Duchi","year":"2011","unstructured":"Duchi, J., Hazan, E., & Singer, Y. (2011). Adaptive subgradient methods for online learning and stochastic optimization. The Journal of Machine Learning Research, 12, 2121\u20132159.","journal-title":"The Journal of Machine Learning Research"},{"key":"5536_CR10","unstructured":"Gittens, A., & Mahoney, M. W. (2013). Revisiting the Nystrom method for improved large-scale machine learning. CoRR. \n                    arXiv:1303.1849\n                    \n                  ."},{"key":"5536_CR11","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-387-21606-5","volume-title":"The elements of statistical learning. Springer series in statistics","author":"T Hastie","year":"2001","unstructured":"Hastie, T., Tibshirani, R., & Friedman, J. (2001). The elements of statistical learning. Springer series in statistics. New York: Springer."},{"key":"5536_CR12","doi-asserted-by":"crossref","unstructured":"Hsieh, C. J., Chang, K. W., Lin, C. J., Keerthi, S. S., & Sundararajan, S. (2008). A dual coordinate descent method for large-scale linear SVM. In ICML (pp. 408\u2013415)","DOI":"10.1145\/1390156.1390208"},{"key":"5536_CR13","doi-asserted-by":"crossref","unstructured":"Huang, J. C., & Jojic, N. (2011). Variable selection through correlation sifting. In RECOMB, Lecture notes in computer science (Vol. 6577, pp. 106\u2013123).","DOI":"10.1007\/978-3-642-20036-6_12"},{"key":"5536_CR14","doi-asserted-by":"publisher","first-page":"411","DOI":"10.1016\/S0893-6080(00)00026-5","volume":"13","author":"A Hyv\u00e4rinen","year":"2000","unstructured":"Hyv\u00e4rinen, A., & Oja, E. (2000). Independent component analysis: Algorithms and applications. Neural Networks, 13, 411\u2013430.","journal-title":"Neural Networks"},{"key":"5536_CR15","unstructured":"Jia, J., & Rohe, K. (2012). Preconditioning to comply with the irrepresentable condition.\n                    arXiv:1208.5584\n                    \n                  ."},{"key":"5536_CR16","unstructured":"Johnson, R., & Zhang, T. (2013). Accelerating stochastic gradient descent using predictive variance reduction. In NIPS (pp. 315\u2013323)."},{"key":"5536_CR17","doi-asserted-by":"crossref","unstructured":"Kogan, S., Levin, D., Routledge, B. R., Sagi, J.S., & Smith, N. A. (2009). Predicting risk from financial reports with regression. In NAACL (pp. 272\u2013280).","DOI":"10.3115\/1620754.1620794"},{"key":"5536_CR18","unstructured":"Krizhevsky, A. (2009). Learning multiple layers of features from tiny images. Master\u2019s thesis. Ph.D. thesis, University of G\u00f6ttingen, G\u00f3ttingen, Germany."},{"key":"5536_CR19","unstructured":"Langer, S. (2007). Preconditioned Newton methods for Ill-posed problems. Ph.D. thesis, University of G\u00f6ttingen, G\u00f6ttingen, Germany."},{"key":"5536_CR20","unstructured":"Le Roux, N., Schmidt, M. W., & Bach, F. (2012). A stochastic gradient method with an exponential convergence rate for finite training sets. In NIPS (pp. 2672\u20132680)."},{"key":"5536_CR21","unstructured":"LeCun, Y., Bottou, L., Orr, G., & M\u00fcller, K. (1998). Efficient backprop. In Neural networks: Tricks of the trade, Lecture notes in computer science. Berlin: Springer."},{"key":"5536_CR22","volume-title":"Multivariate analysis. Probability and mathematical statistics","author":"K Mardia","year":"1979","unstructured":"Mardia, K., Kent, J., & Bibby, J. (1979). Multivariate analysis. Probability and mathematical statistics. London: Academic Press."},{"key":"5536_CR23","unstructured":"Martens, J. (2010). Deep learning via hessian-free optimization. In: ICML (pp. 735\u2013742)."},{"key":"5536_CR24","unstructured":"Needell, D., Ward, R., & Srebro, N. (2014). Stochastic gradient descent, weighted sampling, and the randomized kaczmarz algorithm. In NIPS (pp. 1017\u20131025)."},{"key":"5536_CR25","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4419-8853-9","volume-title":"Introductory lectures on convex optimization: A basic course. Applied optimization","author":"Y Nesterov","year":"2004","unstructured":"Nesterov, Y. (2004). Introductory lectures on convex optimization: A basic course. Applied optimization. Boston: Kluwer Academic."},{"key":"5536_CR26","doi-asserted-by":"publisher","first-page":"1595","DOI":"10.1214\/009053607000000578","volume":"36","author":"D Paul","year":"2008","unstructured":"Paul, D., Bair, E., Hastie, T., & Tibshirani, R. (2008). Preconditioning for feature selection and regression in high-dimensional problems. The Annals of Statistics, 36, 1595\u20131618.","journal-title":"The Annals of Statistics"},{"key":"5536_CR27","doi-asserted-by":"crossref","DOI":"10.1002\/0470841907","volume-title":"Image processing\u2014The fundamentals","author":"M Petrou","year":"1999","unstructured":"Petrou, M., & Bosdogianni, P. (1999). Image processing\u2014The fundamentals. New York: Wiley."},{"key":"5536_CR28","doi-asserted-by":"crossref","unstructured":"Pock, T., & Chambolle, A. (2011). Diagonal preconditioning for first order primal-dual algorithms in convex optimization. In ICCV (pp. 1762\u20131769).","DOI":"10.1109\/ICCV.2011.6126441"},{"key":"5536_CR29","unstructured":"Ranzato, M., Krizhevsky, A., & Hinton, G. E. (2010). Factored 3-way restricted boltzmann machines for modeling natural images. In AISTATS (pp. 621\u2013628)."},{"key":"5536_CR30","unstructured":"Schmidt, M.W., Le Roux, N., & Bach, F. (2013). Minimizing finite sums with the stochastic average gradient. CoRR. \n                    arXiv:1309.2388\n                    \n                  ."},{"issue":"1","key":"5536_CR31","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1007\/s10107-010-0420-4","volume":"127","author":"S Shalev-Shwartz","year":"2011","unstructured":"Shalev-Shwartz, S., Singer, Y., Srebro, N., & Cotter, A. (2011). Pegasos: Primal estimated sub-gradient solver for SVM. Mathematical Programming, 127(1), 3\u201330.","journal-title":"Mathematical Programming"},{"key":"5536_CR32","doi-asserted-by":"crossref","unstructured":"Shalev-Shwartz, S., & Srebro, N. (2008). SVM optimization: Inverse dependence on training set size. In ICML (pp. 928\u2013935).","DOI":"10.1145\/1390156.1390273"},{"key":"5536_CR33","unstructured":"Shalev-Shwartz, S., & Zhang, T. (2013). Accelerated mini-batch stochastic dual coordinate ascent. In NIPS (pp. 378\u2013385)."},{"issue":"1","key":"5536_CR34","first-page":"567","volume":"14","author":"S Shalev-Shwartz","year":"2013","unstructured":"Shalev-Shwartz, S., & Zhang, T. (2013). Stochastic dual coordinate ascent methods for regularized loss. Journal of Machine Learning Research, 14(1), 567\u2013599.","journal-title":"Journal of Machine Learning Research"},{"key":"5536_CR35","unstructured":"Shamir, O., & Zhang, T. (2013). Stochastic gradient descent for non-smooth optimization: Convergence results and optimal averaging schemes. In ICML (pp. 71\u201379)."},{"key":"5536_CR36","unstructured":"Sridharan, K., Shalev-Shwartz, S., & Srebro, N. (2008). Fast rates for regularized objectives. In NIPS (pp. 1545\u20131552)."},{"key":"5536_CR37","unstructured":"Talwalkar, A., & Rostamizadeh, A. (2010). Matrix coherence and the nystrom method. In Proceedings of UAI (pp. 572\u2013579)."},{"issue":"1\u20132","key":"5536_CR38","doi-asserted-by":"publisher","first-page":"115","DOI":"10.1142\/S1793536911000787","volume":"3","author":"JA Tropp","year":"2011","unstructured":"Tropp, J. A. (2011). Improved analysis of the subsampled randomized Hadamard transform. Advances in Adaptive Data Analysis, 3(1\u20132), 115\u2013126.","journal-title":"Advances in Adaptive Data Analysis"},{"key":"5536_CR39","unstructured":"Wauthier, F.L., Jojic, N., & Jordan, M. (2013). A comparative framework for preconditioned lasso algorithms. In NIPS (pp. 1061\u20131069)."},{"issue":"4","key":"5536_CR40","doi-asserted-by":"publisher","first-page":"2057","DOI":"10.1137\/140961791","volume":"24","author":"L Xiao","year":"2014","unstructured":"Xiao, L., & Zhang, T. (2014). A proximal stochastic gradient method with progressive variance reduction. SIAM Journal on Optimization, 24(4), 2057\u20132075.","journal-title":"SIAM Journal on Optimization"},{"key":"5536_CR41","unstructured":"Yang, J., Chow, Y. L., Re, C., & Mahoney, M. W. (2015). Weighted sgd for $$\\ell _p$$ regression with randomized preconditioning. CoRR. \n                    arXiv:1502.03571\n                    \n                  ."},{"key":"5536_CR42","unstructured":"Yang, T., & Jin, R. (2014). Extracting certainty from uncertainty: Transductive pairwise classification from pairwise similarities. In Advances in neural information processing systems (Vol. 27, pp. 262\u2013270)."},{"key":"5536_CR43","unstructured":"Zhang, L., Mahdavi, M., & Jin, R. (2013). Linear convergence with condition number independent access of full gradients. In NIPS (pp. 980\u2013988)."},{"key":"5536_CR44","unstructured":"Zhao, P., & Zhang, T. (2014). Stochastic optimization with importance sampling. CoRR. \n                    arXiv:1401.2753\n                    \n                  ."}],"container-title":["Machine Learning"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-015-5536-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s10994-015-5536-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-015-5536-6","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-015-5536-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,5,17]],"date-time":"2020-05-17T08:04:52Z","timestamp":1589702692000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s10994-015-5536-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,10,20]]},"references-count":44,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2016,4]]}},"alternative-id":["5536"],"URL":"https:\/\/doi.org\/10.1007\/s10994-015-5536-6","relation":{},"ISSN":["0885-6125","1573-0565"],"issn-type":[{"type":"print","value":"0885-6125"},{"type":"electronic","value":"1573-0565"}],"subject":[],"published":{"date-parts":[[2015,10,20]]},"assertion":[{"value":"29 March 2015","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 September 2015","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 October 2015","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}