{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T03:00:33Z","timestamp":1780974033321,"version":"3.54.1"},"reference-count":43,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,7,1]],"date-time":"2026-07-01T00:00:00Z","timestamp":1782864000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100002858","name":"China Postdoctoral Science Foundation","doi-asserted-by":"publisher","award":["2022M710569"],"award-info":[{"award-number":["2022M710569"]}],"id":[{"id":"10.13039\/501100002858","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2022YFB- 4301401"],"award-info":[{"award-number":["2022YFB- 4301401"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61976033"],"award-info":[{"award-number":["61976033"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Expert Systems with Applications"],"published-print":{"date-parts":[[2026,7]]},"DOI":"10.1016\/j.eswa.2026.131663","type":"journal-article","created":{"date-parts":[[2026,3,14]],"date-time":"2026-03-14T07:49:21Z","timestamp":1773474561000},"page":"131663","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Unmanned surface vehicle collision avoidance algorithm based on deep reinforcement learning with discount optimization and multi-step paradigm"],"prefix":"10.1016","volume":"319","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2634-1845","authenticated-orcid":false,"given":"Zhe","family":"Sun","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7828-4902","authenticated-orcid":false,"given":"Yunsheng","family":"Fan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-0547-4884","authenticated-orcid":false,"given":"Zhiyang","family":"Bao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.eswa.2026.131663_bib0001","doi-asserted-by":"crossref","DOI":"10.1016\/j.apor.2021.102735","article-title":"Developing a ship collision risk index estimation model based on dempster-shafer theory","volume":"113","author":"Abebe","year":"2021","journal-title":"Applied Ocean Research"},{"key":"10.1016\/j.eswa.2026.131663_bib0002","series-title":"Advances in behavioral economics","author":"Camerer","year":"2004"},{"issue":"3","key":"10.1016\/j.eswa.2026.131663_bib0003","doi-asserted-by":"crossref","first-page":"1899","DOI":"10.1109\/TITS.2020.3029279","article-title":"Efficient COLREG-compliant collision avoidance in multi-ship encounter situations","volume":"23","author":"Cho","year":"2020","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"issue":"1","key":"10.1016\/j.eswa.2026.131663_bib0004","doi-asserted-by":"crossref","first-page":"108","DOI":"10.1109\/TIV.2022.3153352","article-title":"Path planning based on deep reinforcement learning for autonomous underwater vehicles under ocean current disturbance","volume":"8","author":"Chu","year":"2022","journal-title":"IEEE Transactions on Intelligent Vehicles"},{"key":"10.1016\/j.eswa.2026.131663_bib0005","series-title":"Proceedings of the AAAI conference on artificial intelligence","article-title":"Multi-step reinforcement learning: A unifying algorithm","volume":"vol. 32","author":"De Asis","year":"2018"},{"issue":"3","key":"10.1016\/j.eswa.2026.131663_bib0006","article-title":"Decision neuroscience and neuroeconomics: Recent progress and ongoing challenges","volume":"13","author":"Dennison","year":"2022","journal-title":"Wiley Interdisciplinary Reviews: Cognitive Science"},{"key":"10.1016\/j.eswa.2026.131663_bib0007","unstructured":"Fedus, W., Gelada, C., Bengio, Y., Bellemare, M. G., & Larochelle, H. (2019). Hyperbolic discounting and learning over multiple horizons.arXiv: 1902.06865."},{"issue":"4","key":"10.1016\/j.eswa.2026.131663_bib0008","doi-asserted-by":"crossref","first-page":"543","DOI":"10.1017\/S0373463300022384","article-title":"Traffic capacity","volume":"24","author":"Fujii","year":"1971","journal-title":"The Journal of Navigation"},{"key":"10.1016\/j.eswa.2026.131663_bib0009","doi-asserted-by":"crossref","DOI":"10.1016\/j.oceaneng.2022.111355","article-title":"A COLREGs-compliant guidance strategy for an underactuated unmanned surface vehicle combining potential field with grid map","volume":"255","author":"Han","year":"2022","journal-title":"Ocean Engineering"},{"key":"10.1016\/j.eswa.2026.131663_bib0010","unstructured":"Hernandez-Garcia, J. F., & Sutton, R. S. (2019). Understanding multi-step deep reinforcement learning: A systematic study of the DQN target.arXiv: 1901.07510."},{"key":"10.1016\/j.eswa.2026.131663_bib0011","doi-asserted-by":"crossref","DOI":"10.1016\/j.oceaneng.2022.112378","article-title":"A human-like collision avoidance method for autonomous ship with attention-based deep reinforcement learning","volume":"264","author":"Jiang","year":"2022","journal-title":"Ocean Engineering"},{"key":"10.1016\/j.eswa.2026.131663_bib0012","doi-asserted-by":"crossref","first-page":"184","DOI":"10.3389\/fnbeh.2010.00184","article-title":"A reinforcement learning model of precommitment in decision making","volume":"4","author":"Kurth-Nelson","year":"2010","journal-title":"Frontiers in Behavioral Neuroscience"},{"issue":"1","key":"10.1016\/j.eswa.2026.131663_bib0013","doi-asserted-by":"crossref","first-page":"110","DOI":"10.1109\/JOE.2013.2254214","article-title":"Safe maritime autonomous navigation with COLREGS, using velocity obstacles","volume":"39","author":"Kuwata","year":"2013","journal-title":"IEEE Journal of Oceanic Engineering"},{"issue":"10","key":"10.1016\/j.eswa.2026.131663_bib0014","doi-asserted-by":"crossref","first-page":"9998","DOI":"10.1109\/TIE.2020.3020024","article-title":"Finite distribution estimation-based dynamic window approach to reliable obstacle avoidance of mobile robot","volume":"68","author":"Lee","year":"2020","journal-title":"IEEE Transactions on Industrial Electronics"},{"issue":"4","key":"10.1016\/j.eswa.2026.131663_bib0015","doi-asserted-by":"crossref","first-page":"10216","DOI":"10.1109\/LRA.2022.3190100","article-title":"Hierarchical planning through goal-conditioned offline reinforcement learning","volume":"7","author":"Li","year":"2022","journal-title":"IEEE Robotics and Automation Letters"},{"key":"10.1016\/j.eswa.2026.131663_bib0016","doi-asserted-by":"crossref","DOI":"10.1016\/j.apor.2021.102759","article-title":"A path planning strategy unified with a COLREGS collision avoidance function based on deep reinforcement learning and artificial potential field","volume":"113","author":"Li","year":"2021","journal-title":"Applied Ocean Research"},{"issue":"1","key":"10.1016\/j.eswa.2026.131663_bib0017","article-title":"Lsda-apf: A local obstacle avoidance algorithm for unmanned surface vehicles based on 5g communication environment","volume":"138","author":"Li","year":"2024","journal-title":"CMES-Computer Modeling in Engineering & Sciences"},{"key":"10.1016\/j.eswa.2026.131663_bib0018","doi-asserted-by":"crossref","DOI":"10.1016\/j.apor.2021.102755","article-title":"Autonomous collision avoidance of unmanned surface vehicles based on improved a star and minimum course alteration algorithms","volume":"113","author":"Liang","year":"2021","journal-title":"Applied Ocean Research"},{"issue":"7540","key":"10.1016\/j.eswa.2026.131663_bib0019","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"Mnih","year":"2015","journal-title":"Nature"},{"key":"10.1016\/j.eswa.2026.131663_bib0020","series-title":"Decision awareness in reinforcement learning workshop at ICML 2022","article-title":"Hyperbolically discounted advantage estimation for generalization in reinforcement learning","author":"Nafi","year":"2022"},{"issue":"7950","key":"10.1016\/j.eswa.2026.131663_bib0021","doi-asserted-by":"crossref","first-page":"30","DOI":"10.1038\/d41586-023-00557-5","article-title":"Autonomous ships are on the horizon: Here\u2019s what we need to know","volume":"615","author":"Negenborn","year":"2023","journal-title":"Nature"},{"issue":"2","key":"10.1016\/j.eswa.2026.131663_bib0022","doi-asserted-by":"crossref","first-page":"188","DOI":"10.1109\/TRO.2004.838008","article-title":"A convergent dynamic window approach to obstacle avoidance","volume":"21","author":"Ogren","year":"2005","journal-title":"IEEE Transactions on Robotics"},{"issue":"7","key":"10.1016\/j.eswa.2026.131663_bib0023","doi-asserted-by":"crossref","first-page":"4415","DOI":"10.1109\/TSMC.2021.3096935","article-title":"An improved dyna-q algorithm for mobile robot path planning in unknown dynamic environment","volume":"52","author":"Pei","year":"2021","journal-title":"IEEE Transactions on Systems, Man, and Cybernetics: Systems"},{"key":"10.1016\/j.eswa.2026.131663_bib0024","doi-asserted-by":"crossref","DOI":"10.1016\/j.oceaneng.2020.108423","article-title":"Effective ship domain\u2013impact of ship size and speed","volume":"219","author":"Pietrzykowski","year":"2021","journal-title":"Ocean Engineering"},{"issue":"3","key":"10.1016\/j.eswa.2026.131663_bib0025","doi-asserted-by":"crossref","first-page":"515","DOI":"10.1007\/s40732-019-00368-z","article-title":"Hyperbolic discounting with environmental outcomes across time, space, and probability","volume":"70","author":"Sargisson","year":"2020","journal-title":"The Psychological Record"},{"key":"10.1016\/j.eswa.2026.131663_bib0026","doi-asserted-by":"crossref","first-page":"187","DOI":"10.1016\/j.oceaneng.2018.09.016","article-title":"A constrained a* approach towards optimal path planning for an unmanned surface vehicle in a maritime environment containing dynamic obstacles and ocean currents","volume":"169","author":"Singh","year":"2018","journal-title":"Ocean Engineering"},{"issue":"5","key":"10.1016\/j.eswa.2026.131663_bib0027","doi-asserted-by":"crossref","first-page":"2834","DOI":"10.1109\/TITS.2020.2976567","article-title":"A formation autonomous navigation system for unmanned surface vehicles with distributed control strategy","volume":"22","author":"Sun","year":"2020","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"key":"10.1016\/j.eswa.2026.131663_bib0028","series-title":"Reinforcement learning: An introduction","author":"Sutton","year":"2018"},{"key":"10.1016\/j.eswa.2026.131663_bib0029","doi-asserted-by":"crossref","first-page":"257","DOI":"10.1007\/s00773-010-0089-7","article-title":"Collision risk assessment for ships","volume":"15","author":"Tam","year":"2010","journal-title":"Journal of Marine Science and Technology"},{"issue":"3","key":"10.1016\/j.eswa.2026.131663_bib0030","doi-asserted-by":"crossref","first-page":"2358","DOI":"10.1109\/TVT.2021.3136670","article-title":"Autonomous pilot of unmanned surface vehicles: Bridging path planning and tracking","volume":"71","author":"Wang","year":"2021","journal-title":"IEEE Transactions on Vehicular Technology"},{"key":"10.1016\/j.eswa.2026.131663_bib0031","doi-asserted-by":"crossref","DOI":"10.1016\/j.oceaneng.2023.116527","article-title":"Deep reinforcement learning based collision avoidance system for autonomous ships","volume":"292","author":"Wang","year":"2024","journal-title":"Ocean Engineering"},{"key":"10.1016\/j.eswa.2026.131663_bib0032","doi-asserted-by":"crossref","first-page":"2665","DOI":"10.1007\/s13042-020-01144-0","article-title":"Online planning for relative optimal and safe paths for USVs using a dual sampling domain reduction-based RRT* method","volume":"11","author":"Wen","year":"2020","journal-title":"International Journal of Machine Learning and Cybernetics"},{"key":"10.1016\/j.eswa.2026.131663_bib0033","doi-asserted-by":"crossref","DOI":"10.1016\/j.oceaneng.2020.107001","article-title":"Collision avoidance for an unmanned surface vehicle using deep reinforcement learning","volume":"199","author":"Woo","year":"2020","journal-title":"Ocean Engineering"},{"issue":"3","key":"10.1016\/j.eswa.2026.131663_bib0034","doi-asserted-by":"crossref","first-page":"2093","DOI":"10.1109\/TITS.2020.3031962","article-title":"Achieving real-time path planning in unknown environments through deep neural networks","volume":"23","author":"Wu","year":"2020","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"issue":"11","key":"10.1016\/j.eswa.2026.131663_bib0035","doi-asserted-by":"crossref","first-page":"11262","DOI":"10.1109\/JSEN.2022.3222575","article-title":"Research on collision avoidance algorithm of unmanned surface vehicle based on deep reinforcement learning","volume":"23","author":"Xia","year":"2022","journal-title":"IEEE Sensors Journal"},{"issue":"4","key":"10.1016\/j.eswa.2026.131663_bib0036","doi-asserted-by":"crossref","first-page":"2700","DOI":"10.1109\/TRO.2023.3257549","article-title":"Drl-vo: Learning to navigate through crowded dynamic scenes using velocity obstacles","volume":"39","author":"Xie","year":"2023","journal-title":"IEEE Transactions on Robotics"},{"issue":"6","key":"10.1016\/j.eswa.2026.131663_bib0037","doi-asserted-by":"crossref","first-page":"5068","DOI":"10.1109\/TIE.2020.2992978","article-title":"Informed anytime fast marching tree for asymptotically optimal motion planning","volume":"68","author":"Xu","year":"2020","journal-title":"IEEE Transactions on Industrial Electronics"},{"key":"10.1016\/j.eswa.2026.131663_bib0038","doi-asserted-by":"crossref","DOI":"10.1016\/j.oceaneng.2022.110749","article-title":"Colregs-abiding hybrid collision avoidance algorithm based on deep reinforcement learning for usvs","volume":"247","author":"Xu","year":"2022","journal-title":"Ocean Engineering"},{"issue":"3","key":"10.1016\/j.eswa.2026.131663_bib0039","doi-asserted-by":"crossref","first-page":"1983","DOI":"10.1109\/TASE.2022.3190901","article-title":"Intelligent path planning of underwater robot based on reinforcement learning","volume":"20","author":"Yang","year":"2022","journal-title":"IEEE Transactions on Automation Science and Engineering"},{"issue":"9","key":"10.1016\/j.eswa.2026.131663_bib0040","doi-asserted-by":"crossref","first-page":"9518","DOI":"10.1109\/TVT.2020.3004140","article-title":"A hierarchical architecture using biased min-consensus for USV path planning","volume":"69","author":"Yao","year":"2020","journal-title":"IEEE Transactions on Vehicular Technology"},{"issue":"4","key":"10.1016\/j.eswa.2026.131663_bib0041","doi-asserted-by":"crossref","first-page":"2413","DOI":"10.1109\/LRA.2023.3245409","article-title":"Svf-rrt*: A stream-based vf-rrt* for usvs path planning considering ocean currents","volume":"8","author":"Zhang","year":"2023","journal-title":"IEEE Robotics and Automation Letters"},{"key":"10.1016\/j.eswa.2026.131663_bib0042","doi-asserted-by":"crossref","DOI":"10.1016\/j.oceaneng.2022.112557","article-title":"Decision-making for the autonomous navigation of USVs based on deep reinforcement learning under IALA maritime buoyage system","volume":"266","author":"Zhao","year":"2022","journal-title":"Ocean Engineering"},{"key":"10.1016\/j.eswa.2026.131663_bib0043","doi-asserted-by":"crossref","DOI":"10.1016\/j.oceaneng.2024.117096","article-title":"Adaptive collision avoidance decisions in autonomous ship encounter scenarios through rule-guided vision supervised learning","volume":"297","author":"Zheng","year":"2024","journal-title":"Ocean Engineering"}],"container-title":["Expert Systems with Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426005762?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426005762?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T02:53:27Z","timestamp":1780973607000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0957417426005762"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7]]},"references-count":43,"alternative-id":["S0957417426005762"],"URL":"https:\/\/doi.org\/10.1016\/j.eswa.2026.131663","relation":{},"ISSN":["0957-4174"],"issn-type":[{"value":"0957-4174","type":"print"}],"subject":[],"published":{"date-parts":[[2026,7]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Unmanned surface vehicle collision avoidance algorithm based on deep reinforcement learning with discount optimization and multi-step paradigm","name":"articletitle","label":"Article Title"},{"value":"Expert Systems with Applications","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.eswa.2026.131663","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"131663"}}