{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,11]],"date-time":"2026-05-11T10:47:31Z","timestamp":1778496451740,"version":"3.51.4"},"reference-count":131,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2021]]},"DOI":"10.1109\/tpami.2021.3071289","type":"journal-article","created":{"date-parts":[[2021,4,6]],"date-time":"2021-04-06T20:03:56Z","timestamp":1617739436000},"page":"1-1","source":"Crossref","is-referenced-by-count":7,"title":["The Loss Surface Of Deep Linear Networks Viewed Through The Algebraic Geometry Lens"],"prefix":"10.1109","author":[{"given":"Dhagash","family":"Mehta","sequence":"first","affiliation":[{"name":"the Autonomous and Intelligent Systems Department, East Hartfrot, Connecticut, United States, (e-mail: dhagashbmehta@gmail.com)"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tianran","family":"Chen","sequence":"additional","affiliation":[{"name":"Mathematics and Computer Science, Auburn University at Montgomery, 15666 Montgomery, Alabama, United States, (e-mail: ti@nranchen.org)"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tingting","family":"Tang","sequence":"additional","affiliation":[{"name":"Applied and computational Mathematics and Statistics, San Diego State University - Imperial Valley Campus, 52481 Calexico, California, United States, (e-mail: yiyit62@gmail.com)"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jonathan","family":"Hauenstein","sequence":"additional","affiliation":[{"name":"Applied and computational Mathematics and Statistics, University of Notre Dame, Notre Dame, Indiana, United States, (e-mail: hauenstein@nd.edu)"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1038\/nature14539"},{"key":"ref2","volume-title":"Deep Learning","author":"Goodfellow","year":"2015"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1016\/s0893-6080(05)80010-3"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1016\/0893-6080(89)90014-2"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/34.107014"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/72.410380"},{"key":"ref7","article-title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks,","author":"Saxe","year":"2013"},{"key":"ref8","article-title":"The loss surface of deep and wide neural networks,","author":"Nguyen","year":"2017"},{"key":"ref9","article-title":"Qualitatively characterizing neural network optimization problems,","author":"Goodfellow","year":"2014"},{"key":"ref10","first-page":"1908","article-title":"Learning polynomials with neural networks,","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Andoni"},{"key":"ref11","article-title":"No bad local minima: Data independent training error guarantees for multilayer neural networks,","author":"Soudry","year":"2016"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-019-01374-3"},{"key":"ref13","article-title":"The loss surfaces of multilayer networks,","author":"Choromanska","year":"2014"},{"key":"ref14","article-title":"Deep learning without poor local minima,","author":"Kawaguchi","year":"2016"},{"key":"ref15","article-title":"Exponentially vanishing sub-optimal local minima in multilayer neural networks,","author":"Soudry","year":"2017"},{"key":"ref16","article-title":"Explorations on high dimensional landscapes,","author":"Sagun","year":"2014"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevE.97.052307"},{"key":"ref18","first-page":"410","article-title":"488 solutions to the XOR problem,","volume-title":"Proc. 9th Int. Conf. Adv. Neural Inf. Process. Syst.","author":"Coetzee"},{"key":"ref19","first-page":"17","article-title":"Local minima in training of neural networks,","volume-title":"in Proc. ICLR Conf.","volume":"1050","author":"Swirszcz"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1039\/C7CP01108C"},{"key":"ref21","article-title":"A critical view of global optimality in deep learning,","author":"Yun","year":"2018"},{"issue":"1","key":"ref22","first-page":"91","article-title":"Backpropagation can give rise to spurious local minima even for networks without hidden layers,","volume":"3","author":"Sontag","year":"1989","journal-title":"Complex Syst."},{"key":"ref23","article-title":"Towards understanding generalization of deep learning: Perspective of loss landscapes,","author":"Wu","year":"2017"},{"key":"ref24","article-title":"Generaliation in deep learning,","author":"Kawaguchi","year":"2017"},{"key":"ref25","first-page":"2933","article-title":"Identifying and attacking the saddle point problem in high-dimensional non-convex optimization,","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Dauphin"},{"key":"ref26","article-title":"An empirical analysis of the optimization of deep network loss surfaces,","author":"Im","year":"2016"},{"key":"ref27","article-title":"Are saddles good enough for deep learning?,","author":"Sankar","year":"2017"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1063\/1.1436470"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1080\/00268970410001703363"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevE.84.025702"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1063\/1.4880417"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1063\/1.4875697"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevE.87.052143"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1063\/1.4919696"},{"key":"ref35","first-page":"797","article-title":"Escaping from saddle points \u2014 online stochastic gradient for tensor decomposition,","volume-title":"Proc. 28th Conf. Learn. Theory","author":"Ge"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/s10107-006-0706-8"},{"key":"ref37","first-page":"81","article-title":"Efficient approaches for escaping higher order saddle points in non-convex optimization,","volume-title":"Proc. 29th Annu. Conf. Learn. Theory","author":"Anandkumar"},{"key":"ref38","article-title":"Gradient descent converges to minimizers: The case of non-isolated critical points,","author":"Panageas","year":"2016"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/72.392248"},{"key":"ref40","article-title":"Depth creates no bad local minima,","author":"Lu","year":"2017"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1007\/s10851-019-00889-w"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2012.04.011"},{"key":"ref43","article-title":"Identity matters in deep learning,","author":"Hardt","year":"2016"},{"key":"ref44","article-title":"Global optimality conditions for deep neural networks,","author":"Yun","year":"2017"},{"key":"ref45","article-title":"Critical points of neural networks: Analytical forms and landscape properties,","author":"Zhou","year":"2017"},{"key":"ref46","article-title":"Characterization of gradient dominance and regularity conditions for neural networks,","author":"Zhou","year":"2017"},{"key":"ref47","article-title":"Minnorm training: An algorithm for training over-parameterized deep neural networks,","author":"Bansal","year":"2018"},{"key":"ref48","first-page":"2499","article-title":"How regularization affects the critical points in linear networks,","volume-title":"Proc. 31st Conf. Adv. Neural Inf. Process. Syst.","author":"Taghvaei"},{"key":"ref49","article-title":"Topology and geometry of half-rectified network optimization,","author":"Freeman","year":"2016"},{"key":"ref50","doi-asserted-by":"crossref","DOI":"10.1007\/978-0-387-35651-8","volume-title":"Ideals, Varieties, and Algorithms: An Introduction to Computational Algebraic Geometry and Commutative Algebra","author":"Cox","year":"2007"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4757-6911-1"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1017\/cbo9780511800474"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/s11786-019-00394-8"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1162\/089976604774201668"},{"issue":"1","key":"ref55","doi-asserted-by":"crossref","first-page":"5","DOI":"10.1023\/A:1009655902122","article-title":"Constrained learning in neural networks: Application to stable factorization of 2-D polynomials,","volume":"7","author":"Perantonis","year":"1998","journal-title":"Neural Process. Lett."},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1016\/j.camwa.2005.07.012"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2749575"},{"key":"ref58","article-title":"On loopy belief propagation\u2013local stability analysis for non-vanishing fields,","volume-title":"Proc. Uncertainty Artif. Intell.","author":"Knoll"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/82.142037"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1016\/0893-6080(94)00094-3"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1162\/089976603321891846"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1016\/S0893-6080(97)00036-1"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1142\/5345"},{"key":"ref64","article-title":"Neuronal synchrony in complex-valued deep networks,","author":"Reichert","year":"2013"},{"key":"ref65","article-title":"On complex valued convolutional neural networks,","author":"Guberman","year":"2016"},{"key":"ref66","article-title":"Associative long short-term memory,","author":"Danihelka","year":"2016"},{"key":"ref67","first-page":"4887","article-title":"Full-capacity unitary recurrent neural networks,","volume-title":"Proc. 30th Int. Conf. Neural Inf. Process. Syst.","author":"Wisdom"},{"key":"ref68","article-title":"Deep complex networks,","author":"Trabelsi","year":"2017"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1016\/S0893-6080(03)00168-0"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2012.2183613"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.5555\/3045390.3045509"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.1.1"},{"key":"ref73","first-page":"529","article-title":"Simplifying neural nets by discovering flat minima,","volume-title":"Proc. 7th Int. Conf. Adv. Neural Inf. Process. Syst.","author":"Hochreiter"},{"key":"ref74","article-title":"On large-batch training for deep learning: Generalization gap and sharp minima,","author":"Keskar","year":"2016"},{"key":"ref75","article-title":"Finding flatter minima with SGD,","volume-title":"Proc. 6th Int. Conf. Learn. Representations","author":"Jastrz\u0119bski"},{"key":"ref76","article-title":"Three factors influencing minima in SGD,","author":"Jastrz\u0119bski","year":"2017"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1088\/1742-5468\/ab39d9"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1088\/1742-5468\/2016\/02\/023301"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevE.93.052313"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.1608103113"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1080\/00268976.2018.1483535"},{"key":"ref82","article-title":"Sharp minima can generalize for deep nets,","author":"Dinh","year":"2017"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.1976.1101301"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1993.5.6.910"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevE.52.4225"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1994.6.3.543"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1162\/neco.2006.18.5.1007"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/FOCI.2007.371500"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1016\/S0893-6080(05)80037-1"},{"key":"ref90","first-page":"2422","article-title":"Path-SGD: Path-normalized optimization in deep neural networks,","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Neyshabur"},{"key":"ref91","article-title":"Eigenvalues of the hessian in deep learning: Singularity and beyond,","author":"Sagun","year":"2016"},{"key":"ref92","article-title":"Empirical analysis of the hessian of over-parametrized neural networks,","author":"Sagun","year":"2017"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevE.87.032140"},{"key":"ref94","volume-title":"Transversal Mappings and Flows","author":"Abraham","year":"1967"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1090\/S0025-5718-1978-0492046-9"},{"key":"ref96","volume-title":"Introduction to Numerical Continuation Methods","author":"Allgower","year":"1979"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1016\/0096-3003(89)90099-4"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-72453-9_8"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1142\/5763"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1016\/S1570-8659(02)11004-0"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1137\/1.9780898719154"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1137\/1.9781611972702"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1007\/BF01075595"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1090\/S0025-5718-1995-1297471-4"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1090\/S0025-5718-96-00778-8"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1006\/jcom.1996.0009"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1016\/j.jco.2007.09.003"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1090\/S0002-9904-1943-08069-X"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1112\/plms\/s2-50.5.390"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1090\/S0273-0979-1995-00571-9"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4612-0701-6"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1142\/9789812778031_0007"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1007\/s10208-004-0119-0"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.3150\/08-BEJ149"},{"key":"ref115","article-title":"Theory II: Landscape of the empirical risk in deep learning,","author":"Liao","year":"2017"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-662-05355-3"},{"key":"ref117","article-title":"Homotopy approaches for the analysis and solution of neural network and other nonlinear systems of equations,","author":"Coetzee","year":"1995"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1109\/72.485634"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2005.1555985"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4615-3344-3_88"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-14612-6_4"},{"key":"ref122","first-page":"79","article-title":"Homotopy analysis for tensor PCA,","volume-title":"Proc. Conf. Learn. Theory","author":"Anandkumar"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1142\/5763"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1016\/0096-3003(87)90064-6"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevLett.107.160602"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevE.85.061103"},{"key":"ref127","article-title":"High-dimensional random fields and random matrix theory,","author":"Fyodorov","year":"2013"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRevE.91.022133"},{"key":"ref129","article-title":"Trivializing the energy landscape of deep networks,","author":"Chaudhari","year":"2015"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1017\/cbo9780511721724"},{"key":"ref131","article-title":"Skip connections eliminate singularities,","author":"Orhan","year":"2017"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/4359286\/09397294.pdf?arnumber=9397294","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,9]],"date-time":"2024-01-09T22:44:16Z","timestamp":1704840256000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9397294\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021]]},"references-count":131,"URL":"https:\/\/doi.org\/10.1109\/tpami.2021.3071289","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021]]}}}