{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,18]],"date-time":"2026-01-18T15:25:13Z","timestamp":1768749913668,"version":"3.49.0"},"reference-count":41,"publisher":"Springer Science and Business Media LLC","issue":"8","license":[{"start":{"date-parts":[[2025,5,28]],"date-time":"2025-05-28T00:00:00Z","timestamp":1748390400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,5,28]],"date-time":"2025-05-28T00:00:00Z","timestamp":1748390400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["SIViP"],"published-print":{"date-parts":[[2025,8]]},"DOI":"10.1007\/s11760-025-04209-1","type":"journal-article","created":{"date-parts":[[2025,5,28]],"date-time":"2025-05-28T13:29:55Z","timestamp":1748438995000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Input normalized stochastic gradient descent for language tasks"],"prefix":"10.1007","volume":"19","author":[{"given":"Esra","family":"T\u00fcreyen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Salih Furkan","family":"At\u0131c\u0131","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ahmet Enis","family":"\u00c7etin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"\u00d6mer","family":"Morg\u00fcl","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,5,28]]},"reference":[{"issue":"11","key":"4209_CR1","doi-asserted-by":"publisher","first-page":"163","DOI":"10.1109\/97.335063","volume":"1","author":"O Arikan","year":"1994","unstructured":"Arikan, O., Enis Cetin, A., Erzin, E.: Adaptive filtering for non-gaussian stable processes. IEEE Signal Processing Letters 1(11), 163\u2013165 (1994)","journal-title":"IEEE Signal Processing Letters"},{"key":"4209_CR2","unstructured":"Atici, S., Pan, H., Cetin, A.E.: \u2018Input normalized stochastic gradient descent training of deep neural networks\u2019, arXiv preprint (2022) arXiv:2212.09921"},{"issue":"2","key":"4209_CR3","first-page":"198","volume":"46","author":"G Aydin","year":"1999","unstructured":"Aydin, G., Arikan, O., Cetin, A.: Robust adaptive filtering algorithms for \/spl alpha\/-stable random processes. IEEE Transactions on Circuits and Systems II: Analog and Digital Signal Processing 46(2), 198\u2013202 (1999)","journal-title":"IEEE Transactions on Circuits and Systems II: Analog and Digital Signal Processing"},{"key":"4209_CR4","doi-asserted-by":"crossref","unstructured":"Bottou, L.: , Large-scale machine learning with stochastic gradient descent, in \u2018Proceedings of COMPSTAT\u20192010: 19th International Conference on Computational StatisticsParis France, August 22-27, 2010 Keynote, Invited and Contributed Papers\u2019, Springer, pp.\u00a0177\u2013186 (2010)","DOI":"10.1007\/978-3-7908-2604-3_16"},{"key":"4209_CR5","unstructured":"Chaudhari, P., Choromanska, A., Soatto, S., LeCun, Y., Baldassi, C., Borgs, C., Chayes, J., Sagun, L., Zecchina, R.: \u2018Entropy-sgd: Biasing gradient descent into wide valleys\u2019. (2017) arXiv: abs\/1611.01838"},{"issue":"10","key":"4209_CR6","doi-asserted-by":"publisher","first-page":"4692","DOI":"10.1109\/TSP.2011.2161474","volume":"59","author":"S Chouvardas","year":"2011","unstructured":"Chouvardas, S., Slavakis, K., Theodoridis, S.: Adaptive robust distributed learning in diffusion sensor networks. IEEE Transactions on Signal Processing 59(10), 4692\u20134707 (2011)","journal-title":"IEEE Transactions on Signal Processing"},{"issue":"2","key":"4209_CR7","doi-asserted-by":"publisher","first-page":"182","DOI":"10.1109\/5.214546","volume":"81","author":"P Combettes","year":"1993","unstructured":"Combettes, P.: The foundations of set theoretic estimation. Proceedings of the IEEE 81(2), 182\u2013208 (1993)","journal-title":"Proceedings of the IEEE"},{"key":"4209_CR8","unstructured":"Defazio, A., Bach, F., Lacoste-Julien, S.: , \u2018Saga: A fast incremental gradient method with support for non-strongly convex composite objectives\u2019 (2014). arXiv: abs\/1407.0202"},{"key":"4209_CR9","unstructured":"Devlin, J.: \u2018Bert: Pre-training of deep bidirectional transformers for language understanding\u2019, arXiv preprint (2018) arXiv:1810.04805"},{"key":"4209_CR10","unstructured":"Dozat, T.: \u2018Incorporating nesterov momentum into adam\u2019 (2016)"},{"key":"4209_CR11","unstructured":"Duchi, J., Hazan, E., Singer, Y.: \u2018Adaptive subgradient methods for online learning and stochastic optimization.\u2019, Journal of machine learning research 12(7) (2011)"},{"key":"4209_CR12","unstructured":"Goyal, P., Doll\u00e1r, P., Girshick, R., Noordhuis, P., Wesolowski, L., Kyrola, A., Tulloch, A., Jia, Y., He, K.: \u2018Accurate, large minibatch sgd: Training imagenet in 1 hour\u2019. (2018) arXiv: abs\/1706.02677"},{"issue":"2","key":"4209_CR13","doi-asserted-by":"publisher","first-page":"169","DOI":"10.1007\/s10994-007-5016-8","volume":"69","author":"E Hazan","year":"2007","unstructured":"Hazan, E., Agarwal, A., Kale, S.: Logarithmic regret algorithms for online convex optimization. Machine Learning 69(2), 169\u2013192 (2007)","journal-title":"Machine Learning"},{"key":"4209_CR14","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: \u2018Deep residual learning for image recognition\u2019 (2015). arXiv: abs\/1512.03385","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"4209_CR15","first-page":"2","volume":"14","author":"G Hinton","year":"2012","unstructured":"Hinton, G., Srivastava, N., Swersky, K.: Neural networks for machine learning lecture 6a overview of mini-batch gradient descent. Cited on 14(8), 2 (2012)","journal-title":"Cited on"},{"key":"4209_CR16","unstructured":"Ioffe, S., Szegedy, C.: \u2018Batch normalization: Accelerating deep network training by reducing internal covariate shift\u2019. (2015) arXiv: abs\/1502.03167"},{"key":"4209_CR17","unstructured":"Johnson, R., Zhang, T.: \u2018Accelerating stochastic gradient descent using predictive variance reduction\u2019, Advances in neural information processing systems 26 (2013)"},{"key":"4209_CR18","unstructured":"Keskar, N.S., Mudigere, D., Nocedal, J., Smelyanskiy, M., Tang, P.T.P.: \u2018On large-batch training for deep learning: Generalization gap and sharp minima\u2019 (2017). arXiv: abs\/1609.04836"},{"key":"4209_CR19","unstructured":"Kingma, D.\u00a0P.: \u2018Adam: A method for stochastic optimization\u2019, arXiv preprint (2014) arXiv:1412.6980"},{"issue":"3","key":"4209_CR20","doi-asserted-by":"publisher","first-page":"936","DOI":"10.1109\/TSP.2010.2090874","volume":"59","author":"Y Kopsinis","year":"2011","unstructured":"Kopsinis, Y., Slavakis, K., Theodoridis, S.: Online sparse system identification and signal reconstruction using projections onto weighted $$\\ell _{1}$$ balls. IEEE Transactions on Signal Processing 59(3), 936\u2013952 (2011). https:\/\/doi.org\/10.1109\/TSP.2010.2090874","journal-title":"IEEE Transactions on Signal Processing"},{"key":"4209_CR21","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: \u2018Imagenet classification with deep convolutional neural networks\u2019, Advances in neural information processing systems 25 (2012)"},{"key":"4209_CR22","unstructured":"Loshchilov, I., Hutter, F.: \u2018Sgdr: Stochastic gradient descent with warm restarts\u2019 (2017). arXiv: abs\/1608.03983"},{"issue":"6","key":"4209_CR23","doi-asserted-by":"publisher","first-page":"2075","DOI":"10.1109\/78.218137","volume":"41","author":"V Mathews","year":"1993","unstructured":"Mathews, V., Xie, Z.: A stochastic gradient adaptive filter with gradient adaptive step size. IEEE Transactions on Signal Processing 41(6), 2075\u20132087 (1993)","journal-title":"IEEE Transactions on Signal Processing"},{"key":"4209_CR24","unstructured":"Nesterov, Y.: \u2018A method for solving the convex programming problem with convergence rate $$o(1\/k^{2})$$\u2019, Proceedings of the USSR Academy of Sciences 269,\u00a0543\u2013547. (1983) https:\/\/api.semanticscholar.org\/CorpusID:145918791"},{"issue":"5","key":"4209_CR25","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/0041-5553(64)90137-5","volume":"4","author":"BT Polyak","year":"1964","unstructured":"Polyak, B.T.: Some methods of speeding up the convergence of iteration methods. Ussr computational mathematics and mathematical physics 4(5), 1\u201317 (1964)","journal-title":"Ussr computational mathematics and mathematical physics"},{"key":"4209_CR26","unstructured":"Reddi, S.\u00a0J., Kale, S., Kumar, S.: \u2018On the convergence of adam and beyond\u2019 (2019). arXiv: abs\/1904.09237"},{"key":"4209_CR27","doi-asserted-by":"crossref","unstructured":"Rumelhart, D.E., Hinton, G.\u00a0E., Williams, R.\u00a0J.: \u2018Learning representations by back-propagating errors\u2019, Nature 323,\u00a0533\u2013536 (1986). https:\/\/api.semanticscholar.org\/CorpusID:205001834","DOI":"10.1038\/323533a0"},{"key":"4209_CR28","unstructured":"Simonyan, K., Zisserman, A.: \u2018Very deep convolutional networks for large-scale image recognition\u2019 (2015). arXiv: abs\/1409.1556"},{"issue":"12","key":"4209_CR29","doi-asserted-by":"publisher","first-page":"4744","DOI":"10.1109\/TSP.2009.2027771","volume":"57","author":"K Slavakis","year":"2009","unstructured":"Slavakis, K., Theodoridis, S., Yamada, I.: Adaptive constrained learning in reproducing kernel hilbert spaces: The robust beamforming case. IEEE Transactions on Signal Processing 57(12), 4744\u20134764 (2009)","journal-title":"IEEE Transactions on Signal Processing"},{"key":"4209_CR30","doi-asserted-by":"publisher","first-page":"703","DOI":"10.1109\/ACSSC.2010.5757653","volume-title":"\u20182010 Conference Record of the Forty Fourth Asilomar Conference on Signals","author":"K Slavakis","year":"2010","unstructured":"Slavakis, K., Theodoridis, S., Yamada, I.: Low complexity projection-based adaptive algorithm for sparse system identification and signal reconstruction. In: \u20182010 Conference Record of the Forty Fourth Asilomar Conference on Signals, pp. 703\u2013707. IEEE, Systems and Computers\u2019 (2010)"},{"issue":"9","key":"4209_CR31","doi-asserted-by":"publisher","first-page":"2811","DOI":"10.1109\/78.236504","volume":"41","author":"D Slock","year":"1993","unstructured":"Slock, D.: On the convergence behavior of the lms and the normalized lms algorithms. IEEE Transactions on Signal Processing 41(9), 2811\u20132825 (1993)","journal-title":"IEEE Transactions on Signal Processing"},{"key":"4209_CR32","unstructured":"Srivastava, N., Hinton, G., Krizhevsky, A., Sutskever, I., Salakhutdinov, R.: , \u2018Dropout: A simple way to prevent neural networks from overfitting\u2019, Journal of Machine Learning Research 15(56),\u00a01929\u20131958 (2014). http:\/\/jmlr.org\/papers\/v15\/srivastava14a.html"},{"issue":"9","key":"4209_CR33","doi-asserted-by":"publisher","first-page":"4795","DOI":"10.1109\/TSP.2010.2051429","volume":"58","author":"N Takahashi","year":"2010","unstructured":"Takahashi, N., Yamada, I., Sayed, A.H.: Diffusion least-mean squares with adaptive combiners: Formulation and performance analysis. IEEE Transactions on Signal Processing 58(9), 4795\u20134810 (2010)","journal-title":"IEEE Transactions on Signal Processing"},{"issue":"1","key":"4209_CR34","doi-asserted-by":"publisher","first-page":"97","DOI":"10.1109\/MSP.2010.938752","volume":"28","author":"S Theodoridis","year":"2010","unstructured":"Theodoridis, S., Slavakis, K., Yamada, I.: Adaptive learning in a world of projections. IEEE Signal Processing Magazine 28(1), 97\u2013123 (2010)","journal-title":"IEEE Signal Processing Magazine"},{"issue":"1","key":"4209_CR35","doi-asserted-by":"publisher","first-page":"97","DOI":"10.1109\/MSP.2010.938752","volume":"28","author":"S Theodoridis","year":"2011","unstructured":"Theodoridis, S., Slavakis, K., Yamada, I.: Adaptive learning in a world of projections. IEEE Signal Processing Magazine 28(1), 97\u2013123 (2011)","journal-title":"IEEE Signal Processing Magazine"},{"key":"4209_CR36","unstructured":"Vaswani, A.: \u2018Attention is all you need\u2019, Advances in Neural Information Processing Systems (2017)"},{"key":"4209_CR37","doi-asserted-by":"crossref","unstructured":"Wang, A.: \u2018Glue: A multi-task benchmark and analysis platform for natural language understanding\u2019, arXiv preprint (2018) arXiv:1804.07461","DOI":"10.18653\/v1\/W18-5446"},{"key":"4209_CR38","unstructured":"Widrow, B., Hoff, M.\u00a0E.: Adaptive switching circuits, in \u2018Neurocomputing: foundations of research\u2019, pp.\u00a0123\u2013134 (1988)"},{"key":"4209_CR39","unstructured":"You, Y., Li, J., Reddi, S., Hseu, J., Kumar, S., Bhojanapalli, S., Song, X., Demmel, J., Keutzer, K., Hsieh, C.-J.: \u2018Large batch optimization for deep learning: Training bert in 76 minutes\u2019 (2020). arXiv: abs\/1904.00962"},{"key":"4209_CR40","unstructured":"Zeiler, M.D.: \u2018Adadelta: An adaptive learning rate method\u2019 (2012). arXiv: abs\/1212.5701"},{"key":"4209_CR41","unstructured":"Zhang, M.\u00a0R., Lucas, J., Hinton, G., Ba, J.: \u2018Lookahead optimizer: k steps forward, 1 step back\u2019. (2019) arXiv: abs\/1907.08610"}],"container-title":["Signal, Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-025-04209-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11760-025-04209-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-025-04209-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,11]],"date-time":"2025-06-11T07:13:13Z","timestamp":1749625993000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11760-025-04209-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,5,28]]},"references-count":41,"journal-issue":{"issue":"8","published-print":{"date-parts":[[2025,8]]}},"alternative-id":["4209"],"URL":"https:\/\/doi.org\/10.1007\/s11760-025-04209-1","relation":{},"ISSN":["1863-1703","1863-1711"],"issn-type":[{"value":"1863-1703","type":"print"},{"value":"1863-1711","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,5,28]]},"assertion":[{"value":"6 February 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 April 2025","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 April 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 May 2025","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"648"}}