{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,12]],"date-time":"2026-05-12T23:41:16Z","timestamp":1778629276426,"version":"3.51.4"},"reference-count":52,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2012,3,22]],"date-time":"2012-03-22T00:00:00Z","timestamp":1332374400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Mach Learn"],"published-print":{"date-parts":[[2012,6]]},"DOI":"10.1007\/s10994-012-5284-9","type":"journal-article","created":{"date-parts":[[2012,3,22]],"date-time":"2012-03-22T23:35:18Z","timestamp":1332459318000},"page":"303-355","source":"Crossref","is-referenced-by-count":16,"title":["Learning sparse gradients for variable selection and dimension reduction"],"prefix":"10.1007","volume":"87","author":[{"given":"Gui-Bo","family":"Ye","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaohui","family":"Xie","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2012,3,22]]},"reference":[{"key":"5284_CR1","doi-asserted-by":"crossref","first-page":"337","DOI":"10.1090\/S0002-9947-1950-0051437-7","volume":"68","author":"N. Aronszajn","year":"1950","unstructured":"Aronszajn, N. (1950). Theory of reproducing kernels. Transactions of the American Mathematical Society, 68, 337\u2013404.","journal-title":"Transactions of the American Mathematical Society"},{"key":"5284_CR2","first-page":"1179","volume":"9","author":"F. R. Bach","year":"2008","unstructured":"Bach, F. R. (2008). Consistency of the group Lasso and multiple kernel learning. The Journal of Machine Learning Research, 9, 1179\u20131225.","journal-title":"The Journal of Machine Learning Research"},{"issue":"6","key":"5284_CR3","doi-asserted-by":"crossref","first-page":"1373","DOI":"10.1162\/089976603321780317","volume":"15","author":"M. Belkin","year":"2003","unstructured":"Belkin, M., & Niyogi, P. (2003). Laplacian eigenmaps for dimensionality reduction and data representation. Neural Computation, 15(6), 1373\u20131396.","journal-title":"Neural Computation"},{"key":"5284_CR4","first-page":"2434","volume":"7","author":"M. Belkin","year":"2006","unstructured":"Belkin, M., Niyogi, P., & Sindhwani, V. (2006). Manifold regularization: a geometric framework for learning from labeled and unlabeled examples. Journal of Machine Learning Research, 7, 2434.","journal-title":"Journal of Machine Learning Research"},{"key":"5284_CR5","doi-asserted-by":"crossref","first-page":"1224","DOI":"10.1214\/08-EJS327","volume":"2","author":"K. Bertin","year":"2008","unstructured":"Bertin, K., & Lecu\u00e9, K. (2008). Selection of variables and dimension reduction in high-dimensional non-parametric regression. Electronic Journal of Statistics, 2, 1224\u20131241.","journal-title":"Electronic Journal of Statistics"},{"key":"5284_CR6","series-title":"IMS lecture notes-monograph series","doi-asserted-by":"crossref","first-page":"177","DOI":"10.1214\/074921707000000148","volume-title":"Complex datasets and inverse problems: tomography, networks and beyond","author":"P. Bickel","year":"2007","unstructured":"Bickel, P., & Li, B. (2007). Local polynomial regression on unknown manifolds. In IMS lecture notes-monograph series: Vol. 54. Complex datasets and inverse problems: tomography, networks and beyond, (177\u2013186)."},{"issue":"2","key":"5284_CR7","doi-asserted-by":"crossref","first-page":"131","DOI":"10.1016\/j.acha.2007.10.002","volume":"24","author":"J. F. Cai","year":"2008","unstructured":"Cai, J. F., Chan, R. H., & Shen, Z. (2008). A framelet-based image inpainting algorithm. Applied and Computational Harmonic Analysis, 24(2), 131\u2013149.","journal-title":"Applied and Computational Harmonic Analysis"},{"issue":"4","key":"5284_CR8","doi-asserted-by":"crossref","first-page":"1168","DOI":"10.1137\/050626090","volume":"4","author":"P. L. Combettes","year":"2005","unstructured":"Combettes, P. L., & Wajs, V. R. (2005). Signal recovery by proximal forward-backward splitting. Multiscale Modeling & Simulation, 4(4), 1168\u20131200 (electronic). doi: 10.1137\/050626090 .","journal-title":"Multiscale Modeling & Simulation"},{"issue":"2","key":"5284_CR9","doi-asserted-by":"crossref","first-page":"147","DOI":"10.1111\/1467-842X.00164","volume":"43","author":"R. D. Cook","year":"2001","unstructured":"Cook, R. D. & Yin, X. (2001). Dimension reduction and visualization in discriminant analysis. Australian & New Zealand Journal of Statistics, 43(2), 147\u2013199. doi: 10.1111\/1467-842X.00164 With a discussion by A. H. Welsh, Trevor Hastie, Mu Zhu, S. J. Sheather, J. W. McKean, Xuming He and Wing-Kam Fung and a rejoinder by the authors.","journal-title":"Australian & New Zealand Journal of Statistics"},{"key":"5284_CR10","doi-asserted-by":"crossref","DOI":"10.1017\/CBO9780511618796","volume-title":"Learning theory: an approximation theory viewpoint","author":"F. Cucker","year":"2007","unstructured":"Cucker, F., & Zhou, D. X. (2007). Learning theory: an approximation theory viewpoint (Vol. 24). Cambridge: Cambridge Univ Press."},{"issue":"11","key":"5284_CR11","doi-asserted-by":"crossref","first-page":"1413","DOI":"10.1002\/cpa.20042","volume":"57","author":"I. Daubechies","year":"2004","unstructured":"Daubechies, I., Defrise, M., & De Mol, C. (2004). An iterative thresholding algorithm for linear inverse problems with a sparsity constraint. Communications on Pure and Applied Mathematics, 57(11), 1413\u20131457. doi: 10.1002\/cpa.20042","journal-title":"Communications on Pure and Applied Mathematics"},{"key":"5284_CR12","first-page":"1265","volume":"3","author":"I. S. Dhillon","year":"2003","unstructured":"Dhillon, I. S., Mallela, S., & Kumar, R. (2003). A divisive information theoretic feature clustering algorithm for text classification. Journal of Machine Learning Research, 3, 1265\u20131287.","journal-title":"Journal of Machine Learning Research"},{"key":"5284_CR13","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4757-2201-7","volume-title":"Riemannian geometry","author":"M. Carmo Do","year":"1992","unstructured":"Do Carmo, M., & Flaherty, F. (1992). Riemannian geometry. Basel: Birkhauser."},{"issue":"3","key":"5284_CR14","doi-asserted-by":"crossref","first-page":"613","DOI":"10.1109\/18.382009","volume":"41","author":"D. L. Donoho","year":"1995","unstructured":"Donoho, D. L. (1995). De-noising by soft-thresholding. IEEE Transactions on Information Theory, 41(3), 613\u2013627.","journal-title":"IEEE Transactions on Information Theory"},{"issue":"4","key":"5284_CR15","doi-asserted-by":"crossref","first-page":"1289","DOI":"10.1109\/TIT.2006.871582","volume":"52","author":"D. L. Donoho","year":"2006","unstructured":"Donoho, D. L. (2006). Compressed sensing. IEEE Transactions on Information Theory, 52(4), 1289\u20131306.","journal-title":"IEEE Transactions on Information Theory"},{"issue":"10","key":"5284_CR16","doi-asserted-by":"crossref","first-page":"5591","DOI":"10.1073\/pnas.1031596100","volume":"100","author":"D. Donoho","year":"2003","unstructured":"Donoho, D., & Grimes, C. (2003). Hessian eigenmaps: locally linear embedding techniques for high-dimensional data. Proceedings of the National Academy of Sciences, 100(10), 5591\u20135596.","journal-title":"Proceedings of the National Academy of Sciences"},{"issue":"2","key":"5284_CR17","doi-asserted-by":"crossref","first-page":"407","DOI":"10.1214\/009053604000000067","volume":"32","author":"B. Efron","year":"2004","unstructured":"Efron, B., Hastie, T., Johnstone, I., & Tibshirani, R. (2004). Least angle regression. Annals of Statistics, 32(2), 407\u2013499 with discussion, and a rejoinder by the authors.","journal-title":"Annals of Statistics"},{"issue":"4","key":"5284_CR18","doi-asserted-by":"crossref","first-page":"1871","DOI":"10.1214\/08-AOS637","volume":"37","author":"K. Fukumizu","year":"2009","unstructured":"Fukumizu, K., Bach, F. R., & Jordan, M. I. (2009). Kernel dimension reduction in regression. Annals of Statistics, 37(4), 1871\u20131905. doi: 10.1214\/08-AOS637","journal-title":"Annals of Statistics"},{"key":"5284_CR19","volume-title":"Matrix computations","author":"G. H. Golub","year":"1989","unstructured":"Golub, G. H., & Van Loan, C. F. (1989). Matrix computations. Baltimore: Johns Hopkins University Press."},{"issue":"5439","key":"5284_CR20","doi-asserted-by":"crossref","first-page":"531","DOI":"10.1126\/science.286.5439.531","volume":"286","author":"T. R. Golub","year":"1999","unstructured":"Golub, T. R., Slonim, D. K., Tamayo, P., Huard, C., Gaasenbeek, M., Mesirov, J. P., Coller, H., Loh, M. L., Downing, J. R., Caligiuri, M. A., Bloomfield, C. D., & Lander, E. S. (1999). Molecular classification of cancer: class discovery and class prediction by gene expression monitoring. Science, 286(5439), 531\u2013537.","journal-title":"Science"},{"issue":"1","key":"5284_CR21","doi-asserted-by":"crossref","first-page":"389","DOI":"10.1023\/A:1012487302797","volume":"46","author":"I. Guyon","year":"2002","unstructured":"Guyon, I., Weston, J., Barnhill, S., & Vapnik, V. (2002). Gene selection for cancer classification using support vector machines. Machine Learning, 46(1), 389\u2013422.","journal-title":"Machine Learning"},{"key":"5284_CR22","first-page":"1157","volume":"3","author":"I. Guyon","year":"2003","unstructured":"Guyon, I., & Ellsseeff, A. (2003). An introduction to variable and feature selection. Journal of Machine Learning Research, 3, 1157\u20131182.","journal-title":"Journal of Machine Learning Research"},{"key":"5284_CR23","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-662-02796-7","volume-title":"Convex analysis and minimization algorithms","author":"J. Hiriart-Urruty","year":"1993","unstructured":"Hiriart-Urruty, J., & Lemar\u00e9chal, C. (1993). Convex analysis and minimization algorithms. Berlin: Springer."},{"issue":"6","key":"5284_CR24","doi-asserted-by":"crossref","first-page":"1537","DOI":"10.1214\/aos\/1015345954","volume":"29","author":"M. Hristache","year":"2001","unstructured":"Hristache, M., Juditsky, A., & Spokoiny, V. (2001). Structure adaptive approach for dimension reduction. Annals of Statistics, 29(6), 1537\u20131566.","journal-title":"Annals of Statistics"},{"issue":"1","key":"5284_CR25","doi-asserted-by":"crossref","first-page":"28","DOI":"10.1214\/009053607000000811","volume":"36","author":"J. Lafferty","year":"2008","unstructured":"Lafferty, J., & Wasserman, L. (2008). Rodeo: sparse, greedy nonparametric regression. Annals of Statistics, 36(1), 28\u201363. doi: 10.1214\/009053607000000811","journal-title":"Annals of Statistics"},{"key":"5284_CR26","first-page":"905","volume-title":"Advances in neural information processing systems","author":"J. Langford","year":"2009","unstructured":"Langford, J., Li, L., & Zhang, T. (2009). Sparse online learning via truncated gradient. In D.\u00a0Koller, D.\u00a0Schuurmans, Y.\u00a0Bengio, L.\u00a0Bottou (Eds.) Advances in neural information processing systems (Vol. 21, pp. 905\u2013912). Cambridge: MIT"},{"issue":"414","key":"5284_CR27","doi-asserted-by":"crossref","first-page":"316","DOI":"10.1080\/01621459.1991.10475035","volume":"86","author":"K. C. Li","year":"1991","unstructured":"Li, K. C. (1991). Sliced inverse regression for dimension reduction. Journal of the American Statistical Association, 86(414), 316\u2013342 with discussion and a rejoinder by the author.","journal-title":"Journal of the American Statistical Association"},{"issue":"420","key":"5284_CR28","doi-asserted-by":"crossref","first-page":"1025","DOI":"10.1080\/01621459.1992.10476258","volume":"87","author":"K. C. Li","year":"1992","unstructured":"Li, K. C. (1992). On principal Hessian directions for data visualization and dimension reduction: another application of Stein\u2019s lemma. Journal of the American Statistical Association, 87(420), 1025\u20131039.","journal-title":"Journal of the American Statistical Association"},{"key":"5284_CR29","doi-asserted-by":"crossref","unstructured":"Li, B., Zha, H., & Chiaromonte, F. (2005) Contour regression: a general approach to dimension reduction. Ann Statist pp 1580\u20131616.","DOI":"10.1214\/009053605000000192"},{"issue":"5","key":"5284_CR30","doi-asserted-by":"crossref","first-page":"2272","DOI":"10.1214\/009053606000000722","volume":"34","author":"Y. Lin","year":"2006","unstructured":"Lin, Y., & Zhang, H. H. (2006). Component selection and smoothing in multivariate nonparametric regression. Annals of Statistics, 34(5), 2272\u20132297. doi: 10.1214\/009053606000000722","journal-title":"Annals of Statistics"},{"key":"5284_CR31","first-page":"1017","volume":"21","author":"L. Mackey","year":"2009","unstructured":"Mackey, L. (2009). Deflation methods for sparse PCA. Advances in Neural Information Processing Systems, 21, 1017\u20131024.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"5284_CR32","first-page":"148","volume":"141","author":"C. McDiarmid","year":"1989","unstructured":"McDiarmid, C. (1989). On the method of bounded differences. Surveys in Combinatorics, 141, 148\u2013188.","journal-title":"Surveys in Combinatorics"},{"issue":"1","key":"5284_CR33","doi-asserted-by":"crossref","first-page":"177","DOI":"10.1162\/0899766052530802","volume":"17","author":"C. A. Micchelli","year":"2005","unstructured":"Micchelli, C. A., & Pontil, M. (2005). On learning vector-valued functions. Neural Computation, 17(1), 177\u2013204. doi: 10.1162\/0899766052530802","journal-title":"Neural Computation"},{"key":"5284_CR34","doi-asserted-by":"crossref","first-page":"297","DOI":"10.1007\/s10994-006-0679-0","volume":"66","author":"C. A. Micchelli","year":"2007","unstructured":"Micchelli, C. A., & Pontil, M. (2007). Feature space perspectives for learning the kernel. Machine Learning, 66, 297\u2013319.","journal-title":"Machine Learning"},{"key":"5284_CR35","first-page":"1612","volume":"23","author":"C. A. Micchelli","year":"2010","unstructured":"Micchelli, C. A., Morales, J. M., & Pontil, M. (2010). A family of penalty functions for structured sparsity. Advances in Neural Information Processing Systems, 23, 1612\u20131623.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"5284_CR36","first-page":"519","volume":"7","author":"S. Mukherjee","year":"2006","unstructured":"Mukherjee, S. Zhou, D.X. (2006). Learning coordinate covariances via gradients. Journal of Machine Learning Research, 7, 519\u2013549.","journal-title":"Journal of Machine Learning Research"},{"key":"5284_CR37","first-page":"2481","volume":"7","author":"S. Mukherjee","year":"2006","unstructured":"Mukherjee, S., & Wu, Q. (2006). Estimation of gradients and coordinate covariation in classification. Journal of Machine Learning Research, 7, 2481\u20132514.","journal-title":"Journal of Machine Learning Research"},{"issue":"1","key":"5284_CR38","doi-asserted-by":"crossref","first-page":"181","DOI":"10.3150\/09-BEJ206","volume":"16","author":"S. Mukherjee","year":"2010","unstructured":"Mukherjee, S., Wu, Q., & Zhou, D. (2010). Learning gradients on manifolds. Bernoulli, 16(1), 181\u2013207.","journal-title":"Bernoulli"},{"issue":"5500","key":"5284_CR39","doi-asserted-by":"crossref","first-page":"2323","DOI":"10.1126\/science.290.5500.2323","volume":"290","author":"S. Roweis","year":"2000","unstructured":"Roweis, S., & Saul, L. (2000). Nonlinear dimensionality reduction by locally linear embedding. Science, 290(5500), 2323\u20132326.","journal-title":"Science"},{"issue":"3","key":"5284_CR40","doi-asserted-by":"crossref","first-page":"1346","DOI":"10.1214\/aos\/1176325632","volume":"22","author":"D. Ruppert","year":"1994","unstructured":"Ruppert, D., & Ward, M. P. (1994). Multivariate locally weighted least squares regression. Annals of Statistics, 22(3), 1346\u20131370.","journal-title":"Annals of Statistics"},{"issue":"423","key":"5284_CR41","doi-asserted-by":"crossref","first-page":"836","DOI":"10.1080\/01621459.1993.10476348","volume":"88","author":"A. M. Samarov","year":"1993","unstructured":"Samarov, A. M. (1993). Exploring regression structure using nonparametric functional estimation. Journal of the American Statistical Association, 88(423), 836\u2013847.","journal-title":"Journal of the American Statistical Association"},{"key":"5284_CR42","volume-title":"Learning with kernels: Support vector machines, regularization, optimization, and beyond","author":"B. Sch\u00f6lkopf","year":"2002","unstructured":"Sch\u00f6lkopf, B., & Smola, A. (2002). Learning with kernels: Support vector machines, regularization, optimization, and beyond. Cambridge: MIT."},{"issue":"5500","key":"5284_CR43","doi-asserted-by":"crossref","first-page":"2319","DOI":"10.1126\/science.290.5500.2319","volume":"290","author":"J. Tenenbaum","year":"2000","unstructured":"Tenenbaum, J., Silva, V., Langford, J. (2000) A global geometric framework for nonlinear dimensionality reduction. Science 290(5500): 2319\u20132323","journal-title":"Science"},{"issue":"1","key":"5284_CR44","doi-asserted-by":"crossref","first-page":"267","DOI":"10.1111\/j.2517-6161.1996.tb02080.x","volume":"58","author":"R. Tibshirani","year":"1996","unstructured":"Tibshirani, R. (1996). Regression shrinkage and selection via the lasso. Journal of the Royal Statistical Society. Series B, Statistical Methodology, 58(1), 267\u2013288.","journal-title":"Journal of the Royal Statistical Society. Series B, Statistical Methodology"},{"key":"5284_CR45","series-title":"Springer Series in Statistics","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4757-2545-2","volume-title":"Weak convergence and empirical processes","author":"A. W. Vaart van\u00a0der","year":"1996","unstructured":"van\u00a0der Vaart, A. W., & Wellner, J. A. (1996). Springer Series in Statistics. Weak convergence and empirical processes. New York: Springer. With applications to statistics."},{"key":"5284_CR46","volume-title":"Statistical learning theory. Adaptive and learning systems for signal processing, communications, and control","author":"V. N. Vapnik","year":"1998","unstructured":"Vapnik, V. N. (1998). Statistical learning theory. Adaptive and learning systems for signal processing, communications, and control. New York: Wiley."},{"key":"5284_CR47","first-page":"1439","volume":"3","author":"J. Weston","year":"2003","unstructured":"Weston, J., Elisseff, A., Sch\u00f6lkopf, B., & Tipping, M. (2003). Use of the zero norm with linear models and kernel methods. Journal of Machine Learning Research, 3, 1439\u20131461.","journal-title":"Journal of Machine Learning Research"},{"issue":"3","key":"5284_CR48","doi-asserted-by":"crossref","first-page":"363","DOI":"10.1111\/1467-9868.03411","volume":"64","author":"Y. Xia","year":"2002","unstructured":"Xia, Y., Tong, H., Li, W. K., & Zhu, L. X. (2002). An adaptive estimation of dimension reduction space. Journal of the Royal Statistical Society. Series B, Statistical Methodology, 64(3), 363\u2013410 10.1111\/1467-9868.03411.","journal-title":"Journal of the Royal Statistical Society. Series B, Statistical Methodology"},{"issue":"3","key":"5284_CR49","doi-asserted-by":"crossref","first-page":"291","DOI":"10.1007\/s10444-007-9049-0","volume":"29","author":"G. B. Ye","year":"2008","unstructured":"Ye, G. B. & Zhou, D. X. (2008). Learning and approximation by Gaussians on Riemannian manifolds. Advances in Computational Mathematics, 29(3), 291\u2013310.","journal-title":"Advances in Computational Mathematics"},{"issue":"1","key":"5284_CR50","doi-asserted-by":"crossref","first-page":"56","DOI":"10.1214\/aos\/1079120130","volume":"32","author":"T. Zhang","year":"2004","unstructured":"Zhang, T. (2004). Statistical behavior and consistency of classification methods based on convex risk minimization. Annals of Statistics, 32(1), 56\u201385. doi: 10.1214\/aos\/1079120130","journal-title":"Annals of Statistics"},{"issue":"2","key":"5284_CR51","doi-asserted-by":"crossref","first-page":"301","DOI":"10.1111\/j.1467-9868.2005.00503.x","volume":"67","author":"H. Zou","year":"2005","unstructured":"Zou, H., & Hastie, T. (2005). Regularization and variable selection via the elastic net. Journal of the Royal Statistical Society. Series B, Statistical Methodology, 67(2), 301\u2013320.","journal-title":"Journal of the Royal Statistical Society. Series B, Statistical Methodology"},{"issue":"2","key":"5284_CR52","doi-asserted-by":"crossref","first-page":"265","DOI":"10.1198\/106186006X113430","volume":"15","author":"H. Zou","year":"2006","unstructured":"Zou, H., Hastie, T., & Tibshirani, R. (2006). Sparse principal component analysis. Journal of Computational and Graphical Statistics, 15(2), 265\u2013286.","journal-title":"Journal of Computational and Graphical Statistics"}],"container-title":["Machine Learning"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-012-5284-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s10994-012-5284-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10994-012-5284-9","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,4,21]],"date-time":"2024-04-21T21:47:19Z","timestamp":1713736039000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s10994-012-5284-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2012,3,22]]},"references-count":52,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2012,6]]}},"alternative-id":["5284"],"URL":"https:\/\/doi.org\/10.1007\/s10994-012-5284-9","relation":{},"ISSN":["0885-6125","1573-0565"],"issn-type":[{"value":"0885-6125","type":"print"},{"value":"1573-0565","type":"electronic"}],"subject":[],"published":{"date-parts":[[2012,3,22]]}}}