{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,8]],"date-time":"2025-02-08T05:07:43Z","timestamp":1738991263655,"version":"3.37.0"},"reference-count":30,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2025,3,1]],"date-time":"2025-03-01T00:00:00Z","timestamp":1740787200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,3,1]],"date-time":"2025-03-01T00:00:00Z","timestamp":1740787200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,3,1]],"date-time":"2025-03-01T00:00:00Z","timestamp":1740787200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Robot. Autom. Lett."],"published-print":{"date-parts":[[2025,3]]},"DOI":"10.1109\/lra.2025.3535187","type":"journal-article","created":{"date-parts":[[2025,1,28]],"date-time":"2025-01-28T18:51:45Z","timestamp":1738090305000},"page":"2614-2621","source":"Crossref","is-referenced-by-count":0,"title":["Reinforcement Learning of Flexible Policies for Symbolic Instructions With Adjustable Mapping Specifications"],"prefix":"10.1109","volume":"10","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-4030-5142","authenticated-orcid":false,"given":"Wataru","family":"Hatanaka","sequence":"first","affiliation":[{"name":"Digital Strategy Division, RICOH Company, Ltd., Tokyo, Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ryota","family":"Yamashina","sequence":"additional","affiliation":[{"name":"Digital Strategy Division, RICOH Company, Ltd., Tokyo, Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3545-4814","authenticated-orcid":false,"given":"Takamitsu","family":"Matsubara","sequence":"additional","affiliation":[{"name":"Division of Information Science, Graduate School of Science and Technology, Nara Institute of Science and Technology (NAIST), Nara, Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1177\/0278364913495721"},{"volume-title":"Knowledge Representation and Reasoning.","year":"2004","author":"Brachman","key":"ref2"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33012970"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1609\/icaps.v30i1.6750"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i6.20663"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-024-06543-w"},{"key":"ref7","article-title":"PDDL-the planning domain definition language","volume-title":"Proc. AIPS-98 Plan. Competition","author":"Ghallab","year":"1998"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/SFCS.1977.32"},{"key":"ref9","first-page":"452","article-title":"Teaching multiple tasks to an RL agent using LTL","volume-title":"Proc. 17th Int. Conf. Auton. Agents MultiAgent Syst.","author":"Icarte","year":"2018"},{"key":"ref10","first-page":"2107","article-title":"Using reward machines for high-level task specification and decomposition in reinforcement learning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Icarte","year":"2018"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/840"},{"key":"ref12","first-page":"10497","article-title":"LTL2Action: Generalizing LTL instructions for multi-task RL","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Vaezipoor","year":"2021"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2023.3313969"},{"key":"ref14","first-page":"13021","article-title":"A composable specification language for reinforcement learning tasks","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Jothimurugan","year":"2019"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-59152-6_12"},{"key":"ref16","first-page":"1094","article-title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","volume-title":"Proc. Conf. Robot Learn.","author":"Yu","year":"2020"},{"key":"ref17","first-page":"4767","article-title":"Multi-task reinforcement learning with soft modularization","volume-title":"Proc. Adv. in Neural Inf. Process. Syst.","author":"Yang","year":"2020"},{"key":"ref18","first-page":"9767","article-title":"Multi-task reinforcement learning with context-based representations","volume-title":"Proc Int. Conf. Mach. Learn.","author":"Sodhani","year":"2021"},{"key":"ref19","first-page":"785","article-title":"Perceiver-actor: A multi-task transformer for robotic manipulation","volume-title":"Proc. Conf. Robot Learn.","author":"Shridhar","year":"2023"},{"volume-title":"Principles of Model Checking.","year":"2008","author":"Baier","key":"ref20"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1023\/A:1011254632723"},{"key":"ref22","first-page":"1587","article-title":"Optimal policy generation for partially satisfiable co-safe LTL specifications","volume-title":"Proc. 24th Int. Joint Conf. Artif. Intell.","author":"Lacerda","year":"2015"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1016\/S0004-3702(99)00071-5"},{"key":"ref24","first-page":"1665","article-title":"Provably efficient RL with rich observations via latent state decoding","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Du","year":"2019"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11671"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3069908"},{"article-title":"Proximal policy optimization algorithms","year":"2017","author":"Schulman","key":"ref27"},{"article-title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks","year":"2023","author":"Chevalier-Boisvert","key":"ref28"},{"article-title":"ISAAC gym: High performance GPU-based physics simulation for robot learning","year":"2021","author":"Makoviychuk","key":"ref29"},{"article-title":"Guided policy search for parameterized skills using adverbs","year":"2021","author":"Spiegel","key":"ref30"}],"container-title":["IEEE Robotics and Automation Letters"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/7083369\/10849592\/10856348.pdf?arnumber=10856348","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,7]],"date-time":"2025-02-07T06:26:25Z","timestamp":1738909585000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10856348\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,3]]},"references-count":30,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/lra.2025.3535187","relation":{},"ISSN":["2377-3766","2377-3774"],"issn-type":[{"type":"electronic","value":"2377-3766"},{"type":"electronic","value":"2377-3774"}],"subject":[],"published":{"date-parts":[[2025,3]]}}}