{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,10]],"date-time":"2026-04-10T11:02:05Z","timestamp":1775818925882,"version":"3.50.1"},"reference-count":22,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,4]]},"DOI":"10.1109\/icassp.2018.8462272","type":"proceedings-article","created":{"date-parts":[[2018,9,21]],"date-time":"2018-09-21T22:24:48Z","timestamp":1537568688000},"page":"6074-6078","source":"Crossref","is-referenced-by-count":15,"title":["Policy Adaptation for Deep Reinforcement Learning-Based Dialogue Management"],"prefix":"10.1109","author":[{"given":"Lu","family":"Chen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Cheng","family":"Chang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhi","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bowen","family":"Tan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Milica","family":"Gasic","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kai","family":"Yu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","first-page":"733","article-title":"End-to-end task-completion neural dialogue systems","volume":"1","author":"li","year":"2017","journal-title":"Proceedings of IJCNLP"},{"key":"ref11","article-title":"End-to-end optimization of task-oriented dialogue model with deep reinforcement learning","author":"liu","year":"2017","journal-title":"NIPS Workshop in Conversational AI"},{"key":"ref12","article-title":"Pomdp-based dialogue manager adaptation to extended domains","author":"ga\u0161ic","year":"2013","journal-title":"Proceedings of SigDial"},{"key":"ref13","doi-asserted-by":"crossref","first-page":"552","DOI":"10.1016\/j.csl.2016.09.003","article-title":"Dialogue manager domain adaptation using gaussian process reinforcement learning","volume":"45","author":"ga\u0161ic","year":"2017","journal-title":"Computer Speech & Language"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCC.2007.913919"},{"key":"ref15","first-page":"2244","article-title":"Learning multiagent communication with backpropagation","author":"sukhbaatar","year":"2016","journal-title":"Proceedings of NIPS"},{"key":"ref16","first-page":"2137","article-title":"Learning to communicate with deep multi-agent reinforcement learning","author":"jakob","year":"2016","journal-title":"Proceedings of NIPS"},{"key":"ref17","doi-asserted-by":"crossref","first-page":"529","DOI":"10.1038\/nature14236","article-title":"Human-level control through deep reinforcement learning","volume":"518","author":"volodymyr","year":"2015","journal-title":"Nature"},{"key":"ref18","article-title":"The second dialog state tracking challenge","volume":"263","author":"henderson","year":"2014","journal-title":"Proc of SIG-dial"},{"key":"ref19","first-page":"324","article-title":"The third dialog state tracking challenge","author":"henderson","year":"2014","journal-title":"Proceedings of IEEE SLT"},{"key":"ref4","first-page":"1","article-title":"Towards end-to-end learning for dialog state tracking and management using deep reinforcement learning","author":"zhao","year":"2016","journal-title":"Proceedings of SigDial"},{"key":"ref3","first-page":"101","article-title":"Policy networks with two-stage training for dialogue systems","author":"fatemi","year":"2016","journal-title":"Proc of SIG-dial"},{"key":"ref6","article-title":"Sample-efficient actor-critic reinforcement learning with supervised data for dialogue management","author":"su","year":"2017","journal-title":"Proceedings of SigDial"},{"key":"ref5","author":"zachary","year":"2016","journal-title":"Efficient exploration for dialogue policy learning with BBQ networks & replay buffer spiking"},{"key":"ref8","article-title":"Agent-aware dropout dqn for safe and efficient on-line dialogue policy learning","author":"chen","year":"2017","journal-title":"Proceedings of EMNLP"},{"key":"ref7","article-title":"Hybrid code networks: practical and efficient end-to-end dialog control with supervised and reinforcement learning","author":"jason","year":"2017","journal-title":"Proceedings of ACL"},{"key":"ref2","article-title":"Strategic dialogue management via deep reinforcement learning","author":"cuay\u00e1huitl","year":"2015","journal-title":"NIPS Workshop"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2012.2225812"},{"key":"ref9","first-page":"2190","article-title":"Affordable on-line dialogue policy learning","author":"chang","year":"2017","journal-title":"Proceedings of EMNLP"},{"key":"ref20","doi-asserted-by":"crossref","first-page":"149","DOI":"10.3115\/1614108.1614146","article-title":"Agenda-based user simulation for bootstrapping a pomdp dialogue system","author":"schatzmann","year":"2007","journal-title":"Proceedings of NAACL"},{"key":"ref22","first-page":"336","article-title":"Se-mantic parser enhancement for dialogue domain extension with little data","author":"zhu","year":"2014","journal-title":"Proceedings of IEEE SLT"},{"key":"ref21","article-title":"Seman-tically conditioned lstm-based natural language generation for spoken dialogue systems","author":"wen","year":"2015","journal-title":"Proceedings of EMNLP"}],"event":{"name":"ICASSP 2018 - 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Calgary, AB","start":{"date-parts":[[2018,4,15]]},"end":{"date-parts":[[2018,4,20]]}},"container-title":["2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8450881\/8461260\/08462272.pdf?arnumber=8462272","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,8,24]],"date-time":"2020-08-24T05:01:26Z","timestamp":1598245286000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8462272\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,4]]},"references-count":22,"URL":"https:\/\/doi.org\/10.1109\/icassp.2018.8462272","relation":{},"subject":[],"published":{"date-parts":[[2018,4]]}}}