{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T16:00:29Z","timestamp":1782403229146,"version":"3.54.5"},"reference-count":30,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"Research Group GIAP"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2020]]},"DOI":"10.1109\/access.2020.3025194","type":"journal-article","created":{"date-parts":[[2020,9,18]],"date-time":"2020-09-18T20:17:42Z","timestamp":1600460262000},"page":"173227-173238","source":"Crossref","is-referenced-by-count":26,"title":["A Multi-Critic Reinforcement Learning Method: An Application to Multi-Tank Water Systems"],"prefix":"10.1109","volume":"8","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3032-0502","authenticated-orcid":false,"given":"Juan","family":"Martinez-Piazuelo","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5442-1105","authenticated-orcid":false,"given":"Daniel E.","family":"Ochoa","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8688-3195","authenticated-orcid":false,"given":"Nicanor","family":"Quijano","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2492-4422","authenticated-orcid":false,"given":"Luis Felipe","family":"Giraldo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1103\/PhysRev.36.823"},{"key":"ref10","article-title":"Soft actor-critic algorithms and applications","author":"haarnoja","year":"2018","journal-title":"arXiv 1812 05905"},{"key":"ref11","article-title":"Memory-based control with recurrent neural networks","author":"heess","year":"2015","journal-title":"arXiv 1512 04455"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8460528"},{"key":"ref13","first-page":"1","article-title":"Meta learning shared hierarchies","author":"frans","year":"2018","journal-title":"Proc Int Conf Learn Represent (ICLR)"},{"key":"ref14","first-page":"1928","article-title":"Asynchronous methods for deep reinforcement learning","author":"mnih","year":"2016","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref15","first-page":"5392","article-title":"Hybrid reward architecture for reinforcement learning","author":"seijen","year":"2017","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref16","first-page":"207","article-title":"The intentional unintentional agent: Learning to solve many continuous control tasks simultaneously","volume":"78","author":"cabi","year":"2017","journal-title":"Mach Learn Res"},{"key":"ref17","article-title":"Distributed soft actor-critic with multivariate reward representation and knowledge distillation","author":"akimov","year":"2019","journal-title":"arXiv 1911 13056"},{"key":"ref18","first-page":"1","article-title":"Continuous control with deep reinforcement learning","author":"lillicrap","year":"2016","journal-title":"Proc Int Conf Learn Represent (ICLR)"},{"key":"ref19","first-page":"2961","article-title":"Actor-attention-critic for multi-agent reinforcement learning","author":"iqbal","year":"2019","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref28","author":"abadi","year":"2015","journal-title":"TensorFlow Large-Scale Machine Learning on Heterogeneous Systems"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/MCI.2009.932261"},{"key":"ref27","first-page":"4287","article-title":"Learning values across many orders of magnitude","author":"van hasselt","year":"2016","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1201\/9781439821091"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2019.04.026"},{"key":"ref29","first-page":"1","article-title":"Adam: A method for stochastic optimization","author":"kingma","year":"2015","journal-title":"Proc Int Conf Learn Represent (ICLR)"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2017.2773458"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2805379"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2018.8461113"},{"key":"ref2","author":"kirk","year":"2012","journal-title":"Optimal Control Theory An Introduction"},{"key":"ref9","first-page":"1861","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","volume":"80","author":"haarnoja","year":"2018","journal-title":"Proc 35th Int Conf Mach Learn"},{"key":"ref1","volume":"1","author":"sutton","year":"2018","journal-title":"Reinforcement Learning An Introduction"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/277"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.23919\/ACC.2019.8814958"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1016\/j.isatra.2018.01.014"},{"key":"ref24","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"mnih","year":"2015","journal-title":"Nature"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/87.845876"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/SMC.2018.00039"},{"key":"ref25","first-page":"387","article-title":"Deterministic policy gradient algorithms","author":"silver","year":"2014","journal-title":"Proc ICML"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/8948470\/09200594.pdf?arnumber=9200594","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,12,17]],"date-time":"2021-12-17T19:56:02Z","timestamp":1639770962000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9200594\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020]]},"references-count":30,"URL":"https:\/\/doi.org\/10.1109\/access.2020.3025194","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020]]}}}