{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T12:09:37Z","timestamp":1784203777812,"version":"3.55.0"},"reference-count":47,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100001665","name":"French National Research Agency","doi-asserted-by":"publisher","award":["ANR-24-CE23-4369"],"award-info":[{"award-number":["ANR-24-CE23-4369"]}],"id":[{"id":"10.13039\/501100001665","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.neucom.2026.134097","type":"journal-article","created":{"date-parts":[[2026,5,26]],"date-time":"2026-05-26T07:34:30Z","timestamp":1779780870000},"page":"134097","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Towards a validation-less approach for small data: training with neural velocity"],"prefix":"10.1016","volume":"696","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-7354-0838","authenticated-orcid":false,"given":"Gianluca","family":"Dalmasso","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8619-1586","authenticated-orcid":false,"given":"Andrea","family":"Bragagnolo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4274-8298","authenticated-orcid":false,"given":"Enzo","family":"Tartaglione","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9991-6822","authenticated-orcid":false,"given":"Attilio","family":"Fiandrotti","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2709-7864","authenticated-orcid":false,"given":"Marco","family":"Grangetto","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.neucom.2026.134097_bib0005","first-page":"147","article-title":"A learning algorithm for boltzmann machines","volume":"9","author":"Ackley","year":"1985","journal-title":"Cogn. Sci."},{"key":"10.1016\/j.neucom.2026.134097_bib0010","doi-asserted-by":"crossref","first-page":"589","DOI":"10.1162\/neco.1991.3.4.589","article-title":"Temporal evolution of generalization during learning in linear networks","volume":"3","author":"Baldi","year":"1991","journal-title":"Neural Comput."},{"key":"10.1016\/j.neucom.2026.134097_bib0015","first-page":"2556","article-title":"Learning to see by looking at noise","volume":"34","author":"Baradad Jurjo","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.134097_bib0020","first-page":"13","article-title":"Random search for hyper-parameter optimization","author":"Bergstra","year":"2012","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.neucom.2026.134097_bib0025","series-title":"Advances in Neural Information Processing Systems","first-page":"22149","article-title":"To update or not to update? neurons at equilibrium in deep models","author":"Bragagnolo","year":"2022"},{"key":"10.1016\/j.neucom.2026.134097_bib0030","series-title":"Advances in Neural Information Processing Systems","first-page":"8214","article-title":"Gradient descent: The ultimate optimizer","author":"Chandra","year":"2022"},{"key":"10.1016\/j.neucom.2026.134097_bib0035","author":"Chen"},{"key":"10.1016\/j.neucom.2026.134097_bib0040","doi-asserted-by":"crossref","first-page":"35","DOI":"10.1186\/s13040-017-0155-3","article-title":"Ten quick tips for machine learning in computational biology","volume":"10","author":"Chicco","year":"2017","journal-title":"Biodata Min."},{"key":"10.1016\/j.neucom.2026.134097_bib0045","series-title":"Proc. of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","article-title":"The cityscapes dataset for semantic urban scene understanding","author":"Cordts","year":"2016"},{"key":"10.1016\/j.neucom.2026.134097_bib0050","series-title":"Advances in Neural Information Processing Systems","article-title":"Mechanic: A learning rate tuner","author":"Cutkosky","year":"2023"},{"key":"10.1016\/j.neucom.2026.134097_bib0055","series-title":"2025 International Joint Conference on Neural Networks (IJCNN)","first-page":"1","article-title":"Neural velocity for hyperparameter tuning","author":"Dalmasso","year":"2025"},{"key":"10.1016\/j.neucom.2026.134097_bib0060","first-page":"8","article-title":"Geometry of early stopping in linear networks","author":"Dodier","year":"1995","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.134097_bib0065","series-title":"International Conference on Learning Representations","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2021"},{"key":"10.1016\/j.neucom.2026.134097_bib0070","doi-asserted-by":"crossref","first-page":"109","DOI":"10.1016\/j.neunet.2022.11.035","article-title":"Early stopping by correlating online indicators in neural networks","volume":"159","author":"Ferro","year":"2023","journal-title":"Neural Netw."},{"key":"10.1016\/j.neucom.2026.134097_bib0075","doi-asserted-by":"crossref","first-page":"771","DOI":"10.1016\/S0893-6080(05)80122-4","article-title":"Improving model selection by nonconvergent methods","volume":"6","author":"Finnoff","year":"1993","journal-title":"Neural Netw."},{"key":"10.1016\/j.neucom.2026.134097_bib0080","author":"Frankle"},{"key":"10.1016\/j.neucom.2026.134097_bib0085","series-title":"Deep Learning","author":"Goodfellow","year":"2016"},{"key":"10.1016\/j.neucom.2026.134097_bib0090","series-title":"International Conference on Learning Representations","article-title":"In search of lost domain generalization","author":"Gulrajani","year":"2021"},{"key":"10.1016\/j.neucom.2026.134097_bib0095","series-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","first-page":"770","article-title":"Deep residual learning for image recognition","author":"He","year":"2016"},{"key":"10.1016\/j.neucom.2026.134097_bib0100","series-title":"A Practical Guide to Support Vector Classification","author":"Hsu","year":"2003"},{"key":"10.1016\/j.neucom.2026.134097_bib0105","series-title":"Learning and Intelligent Optimization: 5th International Conference, LION 5","first-page":"507","article-title":"Sequential model-based optimization for general algorithm configuration","author":"Hutter","year":"2011"},{"key":"10.1016\/j.neucom.2026.134097_bib0110","doi-asserted-by":"crossref","first-page":"383","DOI":"10.1109\/TAI.2022.3159510","article-title":"Improving calibration and out-of-distribution detection in deep models for medical image segmentation","volume":"4","author":"Karimi","year":"2023","journal-title":"IEEE Trans. Artif. Intell."},{"key":"10.1016\/j.neucom.2026.134097_bib0115","series-title":"2019 IEEE Congress on Evolutionary Computation (CEC)","first-page":"831","article-title":"Evolutionary optimization of hyperparameters in deep learning models","author":"Kim","year":"2019"},{"key":"10.1016\/j.neucom.2026.134097_bib0120","series-title":"3rd International Conference on Learning Representations ICLR 2015, Conference Track","article-title":"Adam: A method for stochastic optimization","author":"Kingma","year":"2015"},{"key":"10.1016\/j.neucom.2026.134097_bib0125","author":"Krizhevsky"},{"key":"10.1016\/j.neucom.2026.134097_bib0130","series-title":"Advances in Neural Information Processing Systems","article-title":"Imagenet classification with deep convolutional neural networks","author":"Krizhevsky","year":"2012"},{"key":"10.1016\/j.neucom.2026.134097_bib0135","first-page":"32","article-title":"Towards explaining the regularization effect of initial large learning rate in training neural networks","author":"Li","year":"2019","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.134097_bib0140","series-title":"International Conference on Machine Learning","first-page":"7045","article-title":"Noise and fluctuation of finite learning rate stochastic gradient descent","author":"Liu","year":"2021"},{"key":"10.1016\/j.neucom.2026.134097_bib0145","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"12009","article-title":"Swin transformer v2: Scaling up capacity and resolution","author":"Liu","year":"2022"},{"key":"10.1016\/j.neucom.2026.134097_bib0150","series-title":"2009 international joint conference on Neural Networks, IEEE","first-page":"1877","article-title":"Evaluation of robustness and performance of early stopping rules with multi layer perceptrons","author":"Lodwich","year":"2009"},{"key":"10.1016\/j.neucom.2026.134097_bib0155","doi-asserted-by":"crossref","first-page":"761","DOI":"10.1016\/S0893-6080(98)00010-0","article-title":"Automatic early stopping using cross validation: quantifying the criteria","volume":"11","author":"Lutz","year":"1998","journal-title":"Neural Netw."},{"key":"10.1016\/j.neucom.2026.134097_bib0160","series-title":"International conference on machine learning","first-page":"2113","article-title":"Gradient-based hyperparameter optimization through reversible learning","author":"Maclaurin","year":"2015"},{"key":"10.1016\/j.neucom.2026.134097_bib0165","series-title":"System Modeling and Optimization: Proceedings of the 10th IFIP Conference","first-page":"473","article-title":"The bayesian approach to global optimization","author":"Mockus","year":"2005"},{"key":"10.1016\/j.neucom.2026.134097_bib0170","article-title":"Generalization and parameter estimation in feedforward nets: Some experiments","volume":"2","author":"Morgan","year":"1989","journal-title":"Advances in neural information processing systems"},{"key":"10.1016\/j.neucom.2026.134097_bib0175","series-title":"Early Stopping \u2014 But When?","first-page":"53","author":"Prechelt","year":"2012"},{"key":"10.1016\/j.neucom.2026.134097_bib0180","author":"Reddi"},{"key":"10.1016\/j.neucom.2026.134097_bib0185","doi-asserted-by":"crossref","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","article-title":"ImageNet Large Scale Visual Recognition Challenge","volume":"115","author":"Russakovsky","year":"2015","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"10.1016\/j.neucom.2026.134097_bib0190","series-title":"3rd International Conference on Learning Representations, ICLR 2015","article-title":"Very deep convolutional networks for large-scale image recognition","author":"Simonyan","year":"2015"},{"key":"10.1016\/j.neucom.2026.134097_bib0195","article-title":"Practical bayesian optimization of machine learning algorithms","volume":"25","author":"Snoek","year":"2012","journal-title":"Advances in neural information processing systems"},{"issue":"3","key":"10.1016\/j.neucom.2026.134097_bib0200","doi-asserted-by":"crossref","first-page":"450","DOI":"10.1109\/TAI.2022.3187680","article-title":"Regressing word and sentence embeddings for low-resource neural machine translation","volume":"4","author":"Unanue","year":"2022","journal-title":"IEEE Trans. Artif. Intell."},{"key":"10.1016\/j.neucom.2026.134097_bib0205","series-title":"2nd international conference on applied mechanics and mechatronics engineering","first-page":"205","article-title":"Early stopping criterion combining probability density function with validation error for improving the generalization capability of the backpropagation neural network","author":"Wang","year":"2017"},{"key":"10.1016\/j.neucom.2026.134097_bib0210","doi-asserted-by":"crossref","first-page":"363","DOI":"10.1007\/s00422-020-00828-8","article-title":"Eo-mtrnn: evolutionary optimization of hyperparameters for a neuro-inspired computational model of spatiotemporal learning","volume":"114","author":"Wieser","year":"2020","journal-title":"Biol. Cybern."},{"key":"10.1016\/j.neucom.2026.134097_bib0215","author":"Wilson"},{"key":"10.1016\/j.neucom.2026.134097_bib0220","series-title":"2019 IEEE International conference on big data (Big Data)","first-page":"1971","article-title":"Demystifying learning rate policies for high accuracy training of deep neural networks","author":"Wu","year":"2019"},{"key":"10.1016\/j.neucom.2026.134097_bib0225","doi-asserted-by":"crossref","first-page":"289","DOI":"10.1007\/s00365-006-0663-2","article-title":"On early stopping in gradient descent learning","volume":"26","author":"Yao","year":"2007","journal-title":"Constr. Approx."},{"key":"10.1016\/j.neucom.2026.134097_bib0230","series-title":"The Twelfth International Conference on Learning Representations","article-title":"Early stopping against label noise without validation data","author":"Yuan","year":"2024"},{"key":"10.1016\/j.neucom.2026.134097_bib0235","series-title":"Proceedings of the British Machine Vision Conference (BMVC)","first-page":"871","article-title":"Wide residual networks","author":"Zagoruyko","year":"2016"}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226014955?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226014955?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T11:46:25Z","timestamp":1784202385000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0925231226014955"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":47,"alternative-id":["S0925231226014955"],"URL":"https:\/\/doi.org\/10.1016\/j.neucom.2026.134097","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Towards a validation-less approach for small data: training with neural velocity","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neucom.2026.134097","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Authors. Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"134097"}}