{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T20:07:23Z","timestamp":1780603643319,"version":"3.54.1"},"reference-count":67,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"6","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"SERB Start-Up Research Grant (SRG), Government of India","award":["SRG\/2023\/001539"],"award-info":[{"award-number":["SRG\/2023\/001539"]}]},{"name":"Kotak AI-ML Ph.D. Fellowship and the Prime Minister\u2019s Research Fellowship, India"},{"name":"Arcot Ramachandran Young Investigator Award Grant of the Indian Institute of Science, Bengaluru, India"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Neural Netw. Learning Syst."],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1109\/tnnls.2025.3637535","type":"journal-article","created":{"date-parts":[[2025,12,12]],"date-time":"2025-12-12T18:36:31Z","timestamp":1765564591000},"page":"2688-2699","source":"Crossref","is-referenced-by-count":0,"title":["Fractional Gradient Descent With Matrix Stepsizes for Non-Convex Optimization"],"prefix":"10.1109","volume":"37","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-7543-0649","authenticated-orcid":false,"given":"Alokendu","family":"Mazumder","sequence":"first","affiliation":[{"name":"Center for Cyber Physical Systems, Indian Institute of Science (Bengaluru), Bengaluru, India"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Keshav","family":"Vyas","sequence":"additional","affiliation":[{"name":"resides in Jaipur, Rajasthan, India"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4835-4556","authenticated-orcid":false,"given":"Punit","family":"Rathore","sequence":"additional","affiliation":[{"name":"Center for Cyber Physical Systems, Indian Institute of Science (Bengaluru), Bengaluru, India"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Non-asymptotic analysis of stochastic approximation algorithms for machine learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"24","author":"Bach"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1561\/2200000050"},{"key":"ref3","first-page":"5200","article-title":"SGD: General analysis and improved rates","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Gower"},{"key":"ref4","article-title":"Distributed learning with compressed gradients","author":"Khirirat","year":"2018","journal-title":"arXiv:1806.06573"},{"key":"ref5","article-title":"Federated learning: Strategies for improving communication efficiency","author":"Kone\u0107n\u00fd","year":"2016","journal-title":"arXiv:1610.05492"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1561\/2200000083"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1093\/imaiai\/iaab006"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1016\/j.jfranklin.2020.01.008"},{"key":"ref9","article-title":"A caputo fractional derivative-based algorithm for optimization","author":"Shin","year":"2021","journal-title":"arXiv:2104.02259"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1590\/S1806-11172011000400002"},{"key":"ref11","volume-title":"The Fractional Calculus Theory and Applications of Differentiation and Integration to Arbitrary Order","author":"Oldham","year":"1974"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1016\/j.physd.2023.133906"},{"key":"ref13","article-title":"Det-CGD: Compressed gradient descent with matrix stepsizes for non-convex optimization","author":"Li","year":"2023","journal-title":"arXiv:2305.12568"},{"key":"ref14","article-title":"Understanding neural networks through deep visualization","author":"Yosinski","year":"2015","journal-title":"arXiv:1506.06579"},{"key":"ref15","article-title":"Visualizing deep neural network decisions: Prediction difference analysis","author":"Zintgraf","year":"2017","journal-title":"arXiv:1702.04595"},{"key":"ref16","article-title":"Adaptive gradient descent for convex and non-convex stochastic optimization","author":"Dvinskikh","year":"2019","journal-title":"arXiv:1911.08380"},{"key":"ref17","first-page":"15383","article-title":"Why are adaptive methods good for attention models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Zhang"},{"key":"ref18","first-page":"1145","article-title":"Proximal stochastic methods for nonsmooth nonconvex finite-sum optimization","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"29","author":"Reddi"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1134\/S1064562419020042"},{"key":"ref20","article-title":"Convergence analysis of fractional gradient descent","author":"Aggarwal","year":"2024","journal-title":"Trans. Mach. Learn. Res."},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1137\/0711002"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1090\/S0025-5718-1980-0551297-4"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/BF01400355"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1090\/S0025-5718-1965-0198670-6"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1137\/1019005"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.24200\/squjs.vol12iss2pp199-209"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1080\/10556788.2013.856909"},{"key":"ref28","first-page":"4617","article-title":"Distributed second order methods with fast rates and compressed communication","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Islamov"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1137\/15M1025487"},{"key":"ref30","first-page":"2082","article-title":"SEGA: Variance reduction via gradient sketching","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"31","author":"Hanzely"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.3233\/JIFS-190861"},{"key":"ref32","article-title":"Block-normalized gradient method: An empirical study for training deep neural network","author":"Wei Yu","year":"2017","journal-title":"arXiv:1707.04822"},{"key":"ref33","article-title":"Stochastic gradient methods with layer-wise adaptive moments for training of deep networks","author":"Ginsburg","year":"2019","journal-title":"arXiv:1905.11286"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i04.5793"},{"key":"ref35","first-page":"9841","article-title":"Theoretically better and numerically faster distributed optimization with smoothness-aware quantization techniques","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Wang"},{"key":"ref36","first-page":"129","article-title":"Natural compression for distributed deep learning","volume-title":"Proc. Math. Sci. Mach. Learn.","author":"Horv\u00f3th"},{"key":"ref37","article-title":"QSGD: Communication-efficient SGD via gradient quantization and encoding","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"30","author":"Alistarh"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1080\/10556788.2024.2358790"},{"key":"ref39","first-page":"3788","article-title":"MARINA: Faster non-convex distributed learning with compression","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Gorbunov"},{"key":"ref40","first-page":"15750","article-title":"ProxSkip: Yes! local gradient steps provably lead to communication acceleration! Finally!","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Mishchenko"},{"key":"ref41","article-title":"GradSkip: Communication-accelerated local gradient methods with better computational complexity","author":"Maranjyan","year":"2022","journal-title":"arXiv:2210.16402"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1080\/10556788.2022.2117355"},{"key":"ref43","article-title":"MARINA meets matrix stepsizes: Variance reduced distributed non-convex optimization","volume-title":"Proc. Int. Workshop Federated Learn. Age Found. Models Conjunct NeurIPS","author":"Li"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1515\/fca-2017-0073"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1002\/mma.7127"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2019.10.017"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/s00034-018-0835-3"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2023.01.002"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1016\/j.chaos.2025.116154"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1016\/j.amc.2023.127944"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2017.02.007"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2022.02.034"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1155\/2023\/7527478"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.3934\/fods.2022009"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1186\/1029-242X-2013-542"},{"issue":"83","key":"ref56","first-page":"1","article-title":"CVXPY: A Python-embedded modeling language for convex optimization","volume":"17","author":"Diamond","year":"2016","journal-title":"J. Mach. Learn. Res."},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1007\/0-387-30528-9_7"},{"key":"ref58","first-page":"5","article-title":"Federated learning: Strategies for improving communication efficiency","volume-title":"Proc. 29th Conf. Neural Inf. Process. Syst. (NIPS)","author":"McMahan"},{"key":"ref59","first-page":"1273","article-title":"Communication-efficient learning of deep networks from decentralized data","volume-title":"Proc. 20th Int. Conf. Artif. Intell. Statist.","author":"McMahan"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2024.3380710"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/JAS.2022.105923"},{"key":"ref62","article-title":"Better theory for SGD in the nonconvex world","author":"Khaled","year":"2020","journal-title":"arXiv:2002.03329"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1145\/1961189.1961199"},{"key":"ref64","first-page":"1306","article-title":"Stochastic polyak step-size for SGD: An adaptive learning rate for fast convergence","volume-title":"Proc. Int. Conf. Artif. Intell. Statist.","author":"Loizou"},{"key":"ref65","first-page":"26943","article-title":"Dynamics of SGD with stochastic polyak stepsizes: Truly adaptive variants and convergence to exact solution","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Orvieto"},{"key":"ref66","article-title":"A stochastic proximal polyak step size","author":"Schaipp","year":"2023","journal-title":"arXiv:2301.04935"},{"key":"ref67","article-title":"Unified optimal analysis of the (stochastic) gradient method","author":"Stich","year":"2019","journal-title":"arXiv:1907.04232"}],"container-title":["IEEE Transactions on Neural Networks and Learning Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/5962385\/11549955\/11298544.pdf?arnumber=11298544","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T19:56:45Z","timestamp":1780603005000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11298544\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":67,"journal-issue":{"issue":"6"},"URL":"https:\/\/doi.org\/10.1109\/tnnls.2025.3637535","relation":{},"ISSN":["2162-237X","2162-2388"],"issn-type":[{"value":"2162-237X","type":"print"},{"value":"2162-2388","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,6]]}}}