{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T04:36:38Z","timestamp":1781238998882,"version":"3.54.1"},"reference-count":30,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,5,25]]},"DOI":"10.23919\/acc50511.2021.9483182","type":"proceedings-article","created":{"date-parts":[[2021,7,28]],"date-time":"2021-07-28T20:29:16Z","timestamp":1627504156000},"page":"3488-3494","source":"Crossref","is-referenced-by-count":30,"title":["Safe Reinforcement Learning with Nonlinear Dynamics via Model Predictive Shielding"],"prefix":"10.23919","author":[{"given":"Osbert","family":"Bastani","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref30","article-title":"Sample complexity of estimating the policy gradient for nearly deterministic dynamical systems","author":"bastani","year":"2020","journal-title":"AISTATS"},{"key":"ref10","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v32i1.11797","article-title":"Safe reinforcement learning via shielding","author":"alshiekh","year":"2018","journal-title":"AAAI"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/3314221.3314638"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2018.8619829"},{"key":"ref13","article-title":"Probabilistic model predictive safety certification for learning-based control","author":"wabersich","year":"2019","journal-title":"ArXiv Preprint"},{"key":"ref14","article-title":"A comprehensive survey on safe reinforcement learning","author":"garcia","year":"2015","journal-title":"JMLR"},{"key":"ref15","article-title":"Concrete problems in ai safety","author":"amodei","year":"2016","journal-title":"ArXiv Preprint"},{"key":"ref16","article-title":"Constrained policy optimization","author":"achiam","year":"2017","journal-title":"ICML"},{"key":"ref17","first-page":"7450","article-title":"Constrained cross-entropy method for safe reinforcement learning","author":"wen","year":"2018","journal-title":"Advances in neural information processing systems"},{"key":"ref18","first-page":"908","article-title":"Safe model-based reinforcement learning with stability guarantees","author":"berkenkamp","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref19","article-title":"Pro-grammatically interpretable reinforcement learning","author":"verma","year":"2018","journal-title":"ArXiv Preprint"},{"key":"ref28","author":"parrilo","year":"2000","journal-title":"Structured Semidefinite Programs and Semialgebraic Geometry Methods in Robustness and Optimization"},{"key":"ref4","article-title":"Verifiable reinforcement learning via policy extraction","author":"bastani","year":"2018","journal-title":"Advances in neural information processing systems"},{"key":"ref27","author":"tedrake","year":"2018","journal-title":"Underactuated Robotics Algorithms for Walking Running Swimming Flying and Manipulation"},{"key":"ref3","first-page":"1","article-title":"Guided policy search","author":"levine","year":"0","journal-title":"International Conference on Machine Learning"},{"key":"ref6","article-title":"Lyapunov design for safe reinforcement learning","author":"perkins","year":"2002","journal-title":"JMLR"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.1983.6313077"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1145\/3302504.3311806"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2014.7039601"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2012.6225136"},{"key":"ref2","article-title":"Graph policy gradients for large scale robot control","author":"khan","year":"2019","journal-title":"CoRL"},{"key":"ref9","article-title":"A lyapunov-based approach to safe reinforcement learning","author":"chow","year":"2018","journal-title":"NeurIPS"},{"key":"ref1","article-title":"Learning dexterous in-hand manipulation","author":"andrychowicz","year":"2018","journal-title":"ArXiv Preprint"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.3182\/20130904-3-FR-2041.00204"},{"key":"ref22","article-title":"Safe exploration in markov decision processes","author":"moldovan","year":"2012","journal-title":"ICML"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CDC.2018.8619572"},{"key":"ref24","article-title":"Conservative bandits","author":"wu","year":"2016","journal-title":"ICML"},{"key":"ref23","article-title":"Safe exploration in finite markov decision processes with gaussian processes","author":"turchetta","year":"2016","journal-title":"NIPS"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2009.V.003"},{"key":"ref25","article-title":"Safely learning to control the constrained linear quadratic regulator","author":"dean","year":"2018","journal-title":"ArXiv Preprint"}],"event":{"name":"2021 American Control Conference (ACC)","location":"New Orleans, LA, USA","start":{"date-parts":[[2021,5,25]]},"end":{"date-parts":[[2021,5,28]]}},"container-title":["2021 American Control Conference (ACC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9482409\/9482614\/09483182.pdf?arnumber=9483182","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,5]],"date-time":"2023-01-05T20:02:50Z","timestamp":1672948970000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9483182\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,5,25]]},"references-count":30,"URL":"https:\/\/doi.org\/10.23919\/acc50511.2021.9483182","relation":{},"subject":[],"published":{"date-parts":[[2021,5,25]]}}}