{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,28]],"date-time":"2026-07-28T21:54:02Z","timestamp":1785275642049,"version":"3.55.0"},"reference-count":46,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"8","license":[{"start":{"date-parts":[[2024,8,1]],"date-time":"2024-08-01T00:00:00Z","timestamp":1722470400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,8,1]],"date-time":"2024-08-01T00:00:00Z","timestamp":1722470400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,8,1]],"date-time":"2024-08-01T00:00:00Z","timestamp":1722470400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2022YFB4701400\/4701403"],"award-info":[{"award-number":["2022YFB4701400\/4701403"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62173314"],"award-info":[{"award-number":["62173314"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Cybern."],"published-print":{"date-parts":[[2024,8]]},"DOI":"10.1109\/tcyb.2023.3298195","type":"journal-article","created":{"date-parts":[[2023,8,11]],"date-time":"2023-08-11T17:27:51Z","timestamp":1691774871000},"page":"4513-4526","source":"Crossref","is-referenced-by-count":31,"title":["Task-Driven Reinforcement Learning With Action Primitives for Long-Horizon Manipulation Skills"],"prefix":"10.1109","volume":"54","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-3132-2809","authenticated-orcid":false,"given":"Hao","family":"Wang","sequence":"first","affiliation":[{"name":"Department of Automation, University of Science and Technology of China, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1669-6984","authenticated-orcid":false,"given":"Hao","family":"Zhang","sequence":"additional","affiliation":[{"name":"Department of Automation, University of Science and Technology of China, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lin","family":"Li","sequence":"additional","affiliation":[{"name":"Department of Automation, University of Science and Technology of China, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2069-9544","authenticated-orcid":false,"given":"Zhen","family":"Kan","sequence":"additional","affiliation":[{"name":"Department of Automation, University of Science and Technology of China, Hefei, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2167-1861","authenticated-orcid":false,"given":"Yongduan","family":"Song","sequence":"additional","affiliation":[{"name":"School of Automation, Chongqing University, Chongqing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1177\/0278364919887447"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2019.2949596"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1016\/j.rcim.2022.102444"},{"key":"ref4","first-page":"1","article-title":"Data-efficient hierarchical reinforcement learning","volume-title":"Proc. Adv. Neural Inf. Proces. Syst.","volume":"31","author":"Nachum"},{"key":"ref5","first-page":"1009","article-title":"Self-consistent trajectory autoencoder: Hierarchical reinforcement learning with trajectory embeddings","volume-title":"Proc. Int. Conf. Machin. Learn","author":"Co-Reyes"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3059912"},{"key":"ref7","first-page":"452","article-title":"Teaching multiple tasks to an RL agent using LTL","volume-title":"Proc. Int. Joint Conf. Auton. Agents Multiagent Syst.","author":"Icarte"},{"key":"ref8","first-page":"10497","article-title":"LTL2Action: Generalizing LTL instructions for multi-task RL","volume-title":"Proc. Int. Conf. Mach. Learn","author":"Vaezipoor"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2021.3101544"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9812140"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2021.3111481"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1177\/02783649211004615"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2805379"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2022.3192049"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2021.3121078"},{"key":"ref16","first-page":"1","article-title":"Discovering motor programs by recomposing demonstrations","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Shankar"},{"key":"ref17","first-page":"2095","article-title":"Residual skill policies: Learning an adaptable skill-based action space for reinforcement learning for robotics","volume-title":"Proc. Conf. Robot. Learn","author":"Rana"},{"key":"ref18","first-page":"589","article-title":"Motion planner augmented reinforcement learning for robot manipulation in obstructed environments","volume-title":"Proc. Conf. Robot. Learn","author":"Yamada"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA40945.2020.9196619"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2013.2289018"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2021.3070385"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA46639.2022.9811707"},{"key":"ref23","first-page":"21847","article-title":"Accelerating robotic reinforcement learning via parameterized action primitives","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"34","author":"Dalal"},{"key":"ref24","article-title":"Meta-learning parameterized skills","author":"Fu","year":"2023","journal-title":"arXiv:2206.03597v3"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2023.3246844"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2021.3138704"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TAC.2020.3006967"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1146\/annurev-control-053018-023717"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.15607\/RSS.2020.XVI.004"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2021.3139380"},{"key":"ref31","volume-title":"Principles of Model Checking","author":"Baier","year":"2008"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1023\/A:1011254632723"},{"key":"ref33","first-page":"1","article-title":"Optimal policy generation for partially satisfiable co-safe LTL specifications","volume-title":"Proc. Int. Joint Conf. Artif. Intell.","author":"Lacerda"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v30i1.10226"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/IROS45743.2020.9341325"},{"key":"ref36","article-title":"Systematic generalisation through task temporal logic and deep reinforcement learning","author":"Le\u00f3n","year":"2020","journal-title":"arXiv:2006.08767"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1016\/S0004-3702(99)00071-5"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref39","article-title":"Exploiting transformer in reinforcement learning for interpretable temporal logic motion planning","author":"Zhang","year":"2022","journal-title":"arXiv:2209.13220"},{"key":"ref40","first-page":"1861","article-title":"Soft actor\u2013critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Haarnoja"},{"key":"ref41","first-page":"188","article-title":"Accelerating reinforcement learning with learned skill priors","volume-title":"Proc. Conf. Robot. Learn","author":"Pertsch"},{"key":"ref42","article-title":"Robosuite: A modular simulation framework and benchmark for robot learning","author":"Zhu","year":"2020","journal-title":"arXiv:2009.12293"},{"key":"ref43","first-page":"1","article-title":"DAC: The double actor\u2013critic architecture for learning options","volume-title":"Proc. Adv. Neural Inf. Proces. Syst.","volume":"32","author":"Zhang"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA40945.2020.9196958"},{"key":"ref45","first-page":"1","article-title":"Learning to coordinate manipulation skills via skill behavior diversification","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Lee"},{"issue":"8","key":"ref46","first-page":"707","article-title":"Binary codes capable of correcting deletions, insertions, and reversals","volume":"10","author":"Levenshtein","year":"1966","journal-title":"Soviet Phys. Doklady"}],"container-title":["IEEE Transactions on Cybernetics"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6221036\/10604457\/10215053.pdf?arnumber=10215053","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,29]],"date-time":"2024-11-29T18:56:09Z","timestamp":1732906569000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10215053\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,8]]},"references-count":46,"journal-issue":{"issue":"8"},"URL":"https:\/\/doi.org\/10.1109\/tcyb.2023.3298195","relation":{},"ISSN":["2168-2267","2168-2275"],"issn-type":[{"value":"2168-2267","type":"print"},{"value":"2168-2275","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,8]]}}}