{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,18]],"date-time":"2025-06-18T04:21:57Z","timestamp":1750220517350,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":18,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,4,19]],"date-time":"2021-04-19T00:00:00Z","timestamp":1618790400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,4,19]]},"DOI":"10.1145\/3442442.3453147","type":"proceedings-article","created":{"date-parts":[[2021,6,3]],"date-time":"2021-06-03T15:56:42Z","timestamp":1622735802000},"page":"114-122","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["A Feature Analysis Tool for Batch RL Datasets"],"prefix":"10.1145","author":[{"given":"Ruiyang","family":"Xu","sequence":"first","affiliation":[{"name":"Northeastern University"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhengxing","family":"Chen","sequence":"additional","affiliation":[{"name":"Facebook"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2021,6,3]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"James Bannon Brad Windsor Wenbo Song and Tao Li. 2020. Causality and Batch Reinforcement Learning: Complementary Approaches To Planning In Unknown Domains. arxiv:2006.02579\u00a0[cs.LG]  James Bannon Brad Windsor Wenbo Song and Tao Li. 2020. Causality and Batch Reinforcement Learning: Complementary Approaches To Planning In Unknown Domains. arxiv:2006.02579\u00a0[cs.LG]"},{"key":"e_1_3_2_1_3_1","volume-title":"Woulda","author":"Buesing Lars","year":"1811","unstructured":"Lars Buesing , Theophane Weber , Yori Zwols , Sebastien Racaniere , Arthur Guez , Jean-Baptiste Lespiau , and Nicolas Heess . 2018. Woulda , Coulda, Shoulda : Counterfactually-Guided Policy Search . arxiv: 1811 .06272\u00a0[cs.LG] Lars Buesing, Theophane Weber, Yori Zwols, Sebastien Racaniere, Arthur Guez, Jean-Baptiste Lespiau, and Nicolas Heess. 2018. Woulda, Coulda, Shoulda: Counterfactually-Guided Policy Search. arxiv:1811.06272\u00a0[cs.LG]"},{"key":"e_1_3_2_1_4_1","unstructured":"Ignasi Clavera Jonas Rothfuss John Schulman Yasuhiro Fujita Tamim Asfour and Pieter Abbeel. 2018. Model-Based Reinforcement Learning via Meta-Policy Optimization. arxiv:1809.05214\u00a0[cs.LG]  Ignasi Clavera Jonas Rothfuss John Schulman Yasuhiro Fujita Tamim Asfour and Pieter Abbeel. 2018. Model-Based Reinforcement Learning via Meta-Policy Optimization. arxiv:1809.05214\u00a0[cs.LG]"},{"key":"e_1_3_2_1_5_1","unstructured":"Justin Fu Aviral Kumar Ofir Nachum George Tucker and Sergey Levine. 2020. D4RL: Datasets for Deep Data-Driven Reinforcement Learning. arxiv:2004.07219\u00a0[cs.LG]  Justin Fu Aviral Kumar Ofir Nachum George Tucker and Sergey Levine. 2020. D4RL: Datasets for Deep Data-Driven Reinforcement Learning. arxiv:2004.07219\u00a0[cs.LG]"},{"key":"e_1_3_2_1_6_1","unstructured":"David Ha and J\u00fcrgen Schmidhuber. 2018. Recurrent World Models Facilitate Policy Evolution. arxiv:1809.01999\u00a0[cs.LG]  David Ha and J\u00fcrgen Schmidhuber. 2018. Recurrent World Models Facilitate Policy Evolution. arxiv:1809.01999\u00a0[cs.LG]"},{"key":"e_1_3_2_1_7_1","unstructured":"Rahul Kidambi Aravind Rajeswaran Praneeth Netrapalli and Thorsten Joachims. 2020. MOReL : Model-Based Offline Reinforcement Learning. arxiv:2005.05951\u00a0[cs.LG]  Rahul Kidambi Aravind Rajeswaran Praneeth Netrapalli and Thorsten Joachims. 2020. MOReL : Model-Based Offline Reinforcement Learning. arxiv:2005.05951\u00a0[cs.LG]"},{"key":"e_1_3_2_1_8_1","unstructured":"Aviral Kumar Justin Fu George Tucker and Sergey Levine. 2019. Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction. arxiv:1906.00949\u00a0[cs.LG]  Aviral Kumar Justin Fu George Tucker and Sergey Levine. 2019. Stabilizing Off-Policy Q-Learning via Bootstrapping Error Reduction. arxiv:1906.00949\u00a0[cs.LG]"},{"key":"e_1_3_2_1_9_1","unstructured":"Thanard Kurutach Ignasi Clavera Yan Duan Aviv Tamar and Pieter Abbeel. 2018. Model-Ensemble Trust-Region Policy Optimization. arxiv:1802.10592\u00a0[cs.LG]  Thanard Kurutach Ignasi Clavera Yan Duan Aviv Tamar and Pieter Abbeel. 2018. Model-Ensemble Trust-Region Policy Optimization. arxiv:1802.10592\u00a0[cs.LG]"},{"key":"e_1_3_2_1_10_1","unstructured":"Yao Liu Omer Gottesman Aniruddh Raghu Matthieu Komorowski Aldo Faisal Finale Doshi-Velez and Emma Brunskill. 2019. Representation Balancing MDPs for Off-Policy Policy Evaluation. arxiv:1805.09044\u00a0[cs.LG]  Yao Liu Omer Gottesman Aniruddh Raghu Matthieu Komorowski Aldo Faisal Finale Doshi-Velez and Emma Brunskill. 2019. Representation Balancing MDPs for Off-Policy Policy Evaluation. arxiv:1805.09044\u00a0[cs.LG]"},{"key":"e_1_3_2_1_11_1","unstructured":"Hongzi Mao Shaileshh\u00a0Bojja Venkatakrishnan Malte Schwarzkopf and Mohammad Alizadeh. 2019. Variance Reduction for Reinforcement Learning in Input-Driven Environments. arxiv:1807.02264\u00a0[cs.LG]  Hongzi Mao Shaileshh\u00a0Bojja Venkatakrishnan Malte Schwarzkopf and Mohammad Alizadeh. 2019. Variance Reduction for Reinforcement Learning in Input-Driven Environments. arxiv:1807.02264\u00a0[cs.LG]"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.1093\/biomet\/82.4.669"},{"key":"e_1_3_2_1_13_1","unstructured":"Danilo\u00a0J. Rezende Ivo Danihelka George Papamakarios Nan\u00a0Rosemary Ke Ray Jiang Theophane Weber Karol Gregor Hamza Merzic Fabio Viola Jane Wang Jovana Mitrovic Frederic Besse Ioannis Antonoglou and Lars Buesing. 2020. Causally Correct Partial Models for Reinforcement Learning. arxiv:2002.02836\u00a0[cs.LG]  Danilo\u00a0J. Rezende Ivo Danihelka George Papamakarios Nan\u00a0Rosemary Ke Ray Jiang Theophane Weber Karol Gregor Hamza Merzic Fabio Viola Jane Wang Jovana Mitrovic Frederic Besse Ioannis Antonoglou and Lars Buesing. 2020. Causally Correct Partial Models for Reinforcement Learning. arxiv:2002.02836\u00a0[cs.LG]"},{"key":"e_1_3_2_1_14_1","unstructured":"Stephane Ross and J.\u00a0Andrew Bagnell. 2012. Agnostic System Identification for Model-Based Reinforcement Learning. arxiv:1203.1007\u00a0[cs.LG]  Stephane Ross and J.\u00a0Andrew Bagnell. 2012. Agnostic System Identification for Model-Based Reinforcement Learning. arxiv:1203.1007\u00a0[cs.LG]"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-141-3.50030-4"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.1145\/122344.122377"},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1016\/B978-1-55860-200-7.50073-8"},{"key":"e_1_3_2_1_18_1","volume-title":"Introduction to Reinforcement Learning","author":"Sutton S.","unstructured":"Richard\u00a0 S. Sutton and Andrew\u00a0 G. Barto . 1998. Introduction to Reinforcement Learning ( 1 st ed.). MIT Press , Cambridge, MA, USA . Richard\u00a0S. Sutton and Andrew\u00a0G. Barto. 1998. Introduction to Reinforcement Learning(1st ed.). MIT Press, Cambridge, MA, USA.","edition":"1"},{"key":"e_1_3_2_1_19_1","unstructured":"Tingwu Wang Xuchan Bao Ignasi Clavera Jerrick Hoang Yeming Wen Eric Langlois Shunshi Zhang Guodong Zhang Pieter Abbeel and Jimmy Ba. 2019. Benchmarking Model-Based Reinforcement Learning. arxiv:1907.02057\u00a0[cs.LG]  Tingwu Wang Xuchan Bao Ignasi Clavera Jerrick Hoang Yeming Wen Eric Langlois Shunshi Zhang Guodong Zhang Pieter Abbeel and Jimmy Ba. 2019. Benchmarking Model-Based Reinforcement Learning. arxiv:1907.02057\u00a0[cs.LG]"}],"event":{"name":"WWW '21: The Web Conference 2021","sponsor":["SIGWEB ACM Special Interest Group on Hypertext, Hypermedia, and Web"],"location":"Ljubljana Slovenia","acronym":"WWW '21"},"container-title":["Companion Proceedings of the Web Conference 2021"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3442442.3453147","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3442442.3453147","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T21:24:35Z","timestamp":1750195475000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3442442.3453147"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,4,19]]},"references-count":18,"alternative-id":["10.1145\/3442442.3453147","10.1145\/3442442"],"URL":"https:\/\/doi.org\/10.1145\/3442442.3453147","relation":{},"subject":[],"published":{"date-parts":[[2021,4,19]]},"assertion":[{"value":"2021-06-03","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}