{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,8]],"date-time":"2026-05-08T16:01:59Z","timestamp":1778256119118,"version":"3.51.4"},"reference-count":59,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2025,3,1]],"date-time":"2025-03-01T00:00:00Z","timestamp":1740787200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,3,1]],"date-time":"2025-03-01T00:00:00Z","timestamp":1740787200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,3,1]],"date-time":"2025-03-01T00:00:00Z","timestamp":1740787200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"Hangzhou Joint Funds of Zhejiang Provincial Natural Science Foundation of China","doi-asserted-by":"publisher","award":["LHZSD24F020001"],"award-info":[{"award-number":["LHZSD24F020001"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for Central Universities","doi-asserted-by":"publisher","award":["226-2024-00058"],"award-info":[{"award-number":["226-2024-00058"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Zhejiang Province High-Level Talents Special Support Program \u201cLeading Talent of Technological Innovation of Ten-Thousands Talents Program\u201d","award":["2022R52046"],"award-info":[{"award-number":["2022R52046"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Intell. Transport. Syst."],"published-print":{"date-parts":[[2025,3]]},"DOI":"10.1109\/tits.2025.3532519","type":"journal-article","created":{"date-parts":[[2025,1,30]],"date-time":"2025-01-30T19:22:47Z","timestamp":1738264967000},"page":"3016-3027","source":"Crossref","is-referenced-by-count":3,"title":["Curricular Subgoals for Inverse Reinforcement Learning"],"prefix":"10.1109","volume":"26","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0584-9129","authenticated-orcid":false,"given":"Shunyu","family":"Liu","sequence":"first","affiliation":[{"name":"State Key Laboratory of Blockchain and Data Security, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7376-9847","authenticated-orcid":false,"given":"Yunpeng","family":"Qing","sequence":"additional","affiliation":[{"name":"College of Computer Science and Technology, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shuqi","family":"Xu","sequence":"additional","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hongyan","family":"Wu","sequence":"additional","affiliation":[{"name":"College of Software Technology, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiangtao","family":"Zhang","sequence":"additional","affiliation":[{"name":"College of Software Technology, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jingyuan","family":"Cong","sequence":"additional","affiliation":[{"name":"College of Computer Science and Technology, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tianhao","family":"Chen","sequence":"additional","affiliation":[{"name":"College of Software Technology, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yun-Fu","family":"Liu","sequence":"additional","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2621-6048","authenticated-orcid":false,"given":"Mingli","family":"Song","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Blockchain and Data Security, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","first-page":"1","article-title":"Hindsight experience replay","volume-title":"Proc. Annu. Conf. Adv. Neural Inf. Process. Syst.","author":"Andrychowicz"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2020.3024655"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1145\/1553374.1553380"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2022.3227738"},{"key":"ref5","article-title":"Scalable Bayesian inverse reinforcement learning","author":"Chan","year":"2021","journal-title":"arXiv:2102.06483"},{"key":"ref6","first-page":"1","article-title":"Goal-conditioned reinforcement learning with imagined subgoals","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Chane-Sane"},{"key":"ref7","first-page":"1","article-title":"Causal confusion in imitation learning","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"de Haan"},{"key":"ref8","first-page":"1","article-title":"Goal-conditioned imitation learning","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"Ding"},{"key":"ref9","first-page":"1","article-title":"One-shot imitation learning","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"Duan"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2022.3214079"},{"key":"ref11","first-page":"1","article-title":"Curriculum-guided hindsight experience replay","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"Fang"},{"key":"ref12","first-page":"1515","article-title":"Automatic goal generation for reinforcement learning agents","volume-title":"Proc. 35th Int. Conf. Mach. Learn.","author":"Florensa"},{"key":"ref13","article-title":"Learning robust rewards with adversarial inverse reinforcement learning","author":"Fu","year":"2017","journal-title":"arXiv:1710.11248"},{"key":"ref14","article-title":"D4RL: Datasets for deep data-driven reinforcement learning","author":"Fu","year":"2020","journal-title":"arXiv:2004.07219"},{"key":"ref15","first-page":"1","article-title":"IQ-learn: Inverse soft-Q learning for imitation","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"Garg"},{"key":"ref16","first-page":"1861","article-title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","volume-title":"Proc. 35th Int. Conf. Mach. Learn.","author":"Haarnoja"},{"key":"ref17","first-page":"1","article-title":"Generative adversarial imitation learning","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"Ho"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-89722-4_12"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2021\/678"},{"key":"ref20","first-page":"1","article-title":"Strictly batch imitation learning by energy-based distribution matching","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"Jarrett"},{"key":"ref21","first-page":"1","article-title":"Regularized inverse reinforcement learning","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Jeon"},{"key":"ref22","first-page":"1","article-title":"Learning to achieve goals","volume-title":"Proc. Int. Joint Conf. Artif. Intell.","author":"Kaelbling"},{"key":"ref23","first-page":"1","article-title":"Discriminator-actor-critic: Addressing sample inefficiency and reward bias in adversarial imitation learning","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Kostrikov"},{"key":"ref24","first-page":"1","article-title":"Imitation learning via off-policy distribution matching","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Kostrikov"},{"key":"ref25","volume-title":"An Environment for Autonomous Driving Decision-Making","year":"2018"},{"key":"ref26","first-page":"1","article-title":"Nonlinear inverse reinforcement learning with Gaussian processes","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","volume":"24","author":"Levine"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2022.3213526"},{"key":"ref28","first-page":"1","article-title":"Active exploration for inverse reinforcement learning","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"Lindner"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i7.20721"},{"key":"ref30","first-page":"1","article-title":"Zero-shot reward specification via grounded natural language","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Mahmoudieh"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2011.2157690"},{"key":"ref32","article-title":"Conditional generative adversarial nets","author":"Mirza","year":"2014","journal-title":"arXiv:1411.1784"},{"key":"ref33","article-title":"Playing Atari with deep reinforcement learning","author":"Mnih","year":"2013","journal-title":"arXiv:1312.5602"},{"key":"ref34","first-page":"1","article-title":"Policy invariance under reward transformations: Theory and application to reward shaping","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Ng"},{"key":"ref35","first-page":"1","article-title":"Algorithms for inverse reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Ng"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2022.117265"},{"key":"ref37","first-page":"1","article-title":"What matters for adversarial imitation learning?","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Orsini"},{"key":"ref38","first-page":"1","article-title":"Learning from trajectories via subgoal discovery","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"Paul"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1991.3.1.88"},{"key":"ref40","article-title":"Temporal difference models: Model-free deep RL for model-based control","author":"Pong","year":"2018","journal-title":"arXiv:1802.09081"},{"key":"ref41","volume-title":"Markov Decision Processes: Discrete Stochastic Dynamic Programming","author":"Puterman","year":"2014"},{"key":"ref42","article-title":"Automated curricula through setter-solver interactions","author":"Racaniere","year":"2019","journal-title":"arXiv:1909.12892"},{"key":"ref43","first-page":"1","article-title":"Toward the fundamental limits of imitation learning","volume-title":"Proc. Annu. Conf. Neural Inf. Process. Syst.","author":"Rajaraman"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2018.XIV.049"},{"key":"ref45","article-title":"SQIL: Imitation learning via reinforcement learning with sparse rewards","author":"Reddy","year":"2019","journal-title":"arXiv:1905.11108"},{"key":"ref46","first-page":"661","article-title":"Efficient reductions for imitation learning","volume-title":"Proc. 13th Int. Conf. Artif. Intell. Statist.","author":"Ross"},{"key":"ref47","first-page":"627","article-title":"A reduction of imitation learning and structured prediction to no-regret online learning","volume-title":"Proc. 14th Int. Conf. Artif. Intell. Statist.","author":"Ross"},{"key":"ref48","first-page":"1312","article-title":"Universal value function approximators","volume-title":"Proc. 32nd Int. Conf. Mach. Learn.","author":"Schaul"},{"key":"ref49","article-title":"Inverse reinforcement learning under noisy observations","author":"Shahryari","year":"2017","journal-title":"arXiv:1710.10116"},{"issue":"69","key":"ref50","first-page":"1","article-title":"Inverse reinforcement learning via nonparametric spatio-temporal subgoal modeling","volume":"19","author":"\u0160o\u0161ic","year":"2018","journal-title":"J. Mach. Learn. Res."},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i7.16749"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i5.16569"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2015.2409870"},{"key":"ref54","first-page":"7194","article-title":"Multi-agent adversarial inverse reinforcement learning","volume-title":"Proc. 36th Int. Conf. Mach. Learn.","author":"Yu"},{"key":"ref55","first-page":"537","article-title":"XIRL: Cross-embodiment inverse reinforcement learning","volume-title":"Proc. 5th Conf. Robot Learn.","author":"Zakka"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2021\/519"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i12.17326"},{"key":"ref58","first-page":"1","article-title":"Maximum entropy inverse reinforcement learning","volume-title":"Proc. AAAI Conf. Artif. Intell.","author":"Ziebart"},{"key":"ref59","first-page":"1255","article-title":"Modeling interaction via the principle of maximum causal entropy","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Ziebart"}],"container-title":["IEEE Transactions on Intelligent Transportation Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6979\/10909032\/10858617.pdf?arnumber=10858617","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,3,4]],"date-time":"2025-03-04T06:01:46Z","timestamp":1741068106000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10858617\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,3]]},"references-count":59,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/tits.2025.3532519","relation":{},"ISSN":["1524-9050","1558-0016"],"issn-type":[{"value":"1524-9050","type":"print"},{"value":"1558-0016","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,3]]}}}