{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,18]],"date-time":"2026-06-18T04:56:20Z","timestamp":1781758580823,"version":"3.54.5"},"reference-count":60,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"computations of this work were carried out using the computers of the Centre of Informatics Tricity Academic Supercomputer & Network (CI TASK), Gda\u0144sk, Poland, under computational Grant","award":["PT01229"],"award-info":[{"award-number":["PT01229"]}]},{"name":"CI TASK for the help and support provided"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/access.2026.3697896","type":"journal-article","created":{"date-parts":[[2026,5,28]],"date-time":"2026-05-28T22:39:09Z","timestamp":1780007949000},"page":"88765-88785","source":"Crossref","is-referenced-by-count":0,"title":["Path-Averaged Gradient Approximation Algorithms for Deep Neural Network Training"],"prefix":"10.1109","volume":"14","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-8144-5315","authenticated-orcid":false,"given":"Rafal","family":"Wolniak","sequence":"first","affiliation":[{"name":"Multimedia Systems Department, Audio Acoustics Laboratory, Faculty of Electronics, Telecommunications and Informatics, Gda&#x0144;sk University of Technology, Gda&#x0144;sk, Poland"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5132-3016","authenticated-orcid":false,"given":"Adam","family":"Kurowski","sequence":"additional","affiliation":[{"name":"Multimedia Systems Department, Audio Acoustics Laboratory, Faculty of Electronics, Telecommunications and Informatics, Gda&#x0144;sk University of Technology, Gda&#x0144;sk, Poland"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6288-2908","authenticated-orcid":false,"given":"Bozena","family":"Kostek","sequence":"additional","affiliation":[{"name":"Multimedia Systems Department, Audio Acoustics Laboratory, Faculty of Electronics, Telecommunications and Informatics, Gda&#x0144;sk University of Technology, Gda&#x0144;sk, Poland"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/icra.2018.8460487"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1016\/j.media.2017.07.005"},{"key":"ref3","article-title":"Adam: A method for stochastic optimization","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Kingma"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/tnnls.2021.3131813"},{"key":"ref5","first-page":"3319","article-title":"Axiomatic attribution for deep networks","volume-title":"Proc. 34th Int. Conf. Mach. Learn.","author":"Sundararajan"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1162\/NECO.a.1514"},{"key":"ref7","volume-title":"Lecture 6.5-RMSPROP: Divide the Gradient By a Running Average of Its Recent Magnitude","author":"Tieleman","year":"2012"},{"key":"ref8","article-title":"SOAP: Improving and stabilizing shampoo using Adam for language modeling","volume-title":"Proc. 13th Int. Conf. Learn. Represent.","author":"Vyas"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2021.02.004"},{"key":"ref10","article-title":"Efficient estimations from a slowly convergent robbins-monro process","author":"Ruppert","year":"1988"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1137\/0330046"},{"key":"ref12","article-title":"Regularizing and optimizing LSTM language models","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Merity"},{"key":"ref13","first-page":"2207","article-title":"A statistical analysis of polyak-ruppert averaged Q-learning","volume-title":"Proc. 26th Int. Conf. Artif. Intell. Statist.","author":"Li"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/icdm.2010.26"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ijcnn55064.2022.9892245"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/tnnls.2019.2955777"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/icpics62053.2024.10797007"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2024.3387399"},{"key":"ref19","article-title":"Sharpness-aware minimization for efficiently improving generalization","volume-title":"Proc. 9th Int. Conf. Learn. Represent.","author":"Foret"},{"key":"ref20","first-page":"11148","article-title":"Fisher SAM: Information geometry and sharpness aware minimisation","volume-title":"Proc. 39th Int. Conf. Mach. Learn.","author":"Kim"},{"key":"ref21","article-title":"Surrogate gap minimization improves sharpness-aware training","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Zhuang"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01204"},{"key":"ref23","first-page":"4424","article-title":"Explicit eigenvalue regularization improves sharpness-aware minimization","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Luo"},{"key":"ref24","article-title":"Momentum-SAM: Sharpness aware minimization without computational overhead","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"Becker"},{"key":"ref25","first-page":"23439","article-title":"Sharpness-aware training for free","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Du"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1145\/3450439.3451865"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/icassp39728.2021.9415064"},{"key":"ref28","volume-title":"Applied Calculus","author":"Hughes-Hallett","year":"2021"},{"key":"ref29","article-title":"Eva: Practical second-order optimization with kronecker-vectorized approximation","volume-title":"Proc. 11th Int. Conf. Learn. Represent.","author":"Zhang"},{"key":"ref30","first-page":"1842","article-title":"Shampoo: Preconditioned stochastic tensor optimization","volume-title":"Proc. 35th Int. Conf. Mach. Learn.","author":"Gupta"},{"key":"ref31","first-page":"2408","article-title":"Optimizing neural networks with kronecker-factored approximate curvature","volume-title":"Proc. 32nd Int. Conf. Mach. Learn.","author":"Martens"},{"key":"ref32","first-page":"573","article-title":"A kronecker-factored approximate Fisher matrix for convolution layers","volume-title":"Proc. 33rd Int. Conf. Mach. Learn.","author":"Grosse"},{"key":"ref33","article-title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","volume-title":"Proc. 12th Int. Conf. Learn. Represent.","author":"Liu"},{"key":"ref34","first-page":"18261","article-title":"An improved analysis of stochastic gradient descent with momentum","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Liu"},{"key":"ref35","first-page":"142","article-title":"Learning word vectors for sentiment analysis","volume-title":"Proc. 49th Annu. meeting Assoc. Comput. Linguistics, Human Lang. Technol.","author":"Maas"},{"key":"ref36","article-title":"ImageNet-OOD: Deciphering modern out-of-distribution detection algorithms","volume-title":"Proc. 12th Int. Conf. Learn. Represent.","author":"Yang"},{"key":"ref37","first-page":"342","article-title":"The shattered gradients problem: If resnets are the answer, then what is the question?","volume-title":"Proc. 34th Int. Conf. Mach. Learn.","author":"Balduzzi"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1007\/s11390-019-1950-8"},{"key":"ref39","first-page":"1107","article-title":"Very deep convolutional networks for text classification","volume-title":"Proc. 15th Conf. Eur. Chapter Assoc. Comput. Linguistics","author":"Conneau"},{"key":"ref40","first-page":"655","article-title":"A convolutional neural network for modelling sentences","volume-title":"Proc. 52nd Annu. Meeting Assoc. Comput. Linguistics (Volume 1: Long Papers)","author":"Kalchbrenner"},{"key":"ref41","first-page":"1746","article-title":"Convolutional neural networks for sentence classification","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process. (EMNLP)","author":"Kim"},{"key":"ref42","first-page":"12002","article-title":"Discovering influential text using convolutional neural networks","volume-title":"Proc. Findings Assoc. Comput. Linguistics ACL","author":"Ayers"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1016\/j.ipm.2023.103320"},{"key":"ref44","first-page":"10524","article-title":"On layer normalization in the transformer architecture","volume-title":"Proc. 37th Int. Conf. Mach. Learn.","author":"Xiong"},{"key":"ref45","first-page":"2488","article-title":"How does batch normalization help optimization?","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"31","author":"Santurkar"},{"key":"ref46","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Dosovitskiy"},{"key":"ref47","article-title":"When vision transformers outperform ResNets without pre-training or strong data augmentations","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Chen"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2009.5206848"},{"key":"ref49","first-page":"735","article-title":"Deep learning via hessian-free optimization","volume-title":"Proc. ICML","author":"Martens"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1016\/j.ejor.2005.06.076"},{"issue":"2","key":"ref51","first-page":"8199","article-title":"An adaptive memory multi-batch L-BFGS algorithm for neural network training","volume-title":"Proc. IFAC-PapersOnLine","volume":"53","author":"Zocco"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1007\/bf01582063"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1162\/089976698300017746"},{"issue":"61","key":"ref54","first-page":"2121","article-title":"Adaptive subgradient methods for online learning and stochastic optimization","volume":"12","author":"Duchi","year":"2011","journal-title":"J. Mach. Learn. Res. JMLR"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4842-2766-4_8"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2016.90"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2015.7298594"},{"key":"ref58","first-page":"5998","article-title":"Attention is all you need","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"30","author":"Vaswani"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177729893"},{"key":"ref60","article-title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","author":"Comanici","year":"2025","journal-title":"arXiv:2507.06261"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/11323511\/11538205.pdf?arnumber=11538205","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,18]],"date-time":"2026-06-18T04:50:43Z","timestamp":1781758243000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11538205\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":60,"URL":"https:\/\/doi.org\/10.1109\/access.2026.3697896","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}