{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,26]],"date-time":"2025-10-26T14:38:45Z","timestamp":1761489525927},"reference-count":29,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"4","license":[{"start":{"date-parts":[[2014,12,1]],"date-time":"2014-12-01T00:00:00Z","timestamp":1417392000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"funder":[{"name":"NSF"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Auton. Mental Dev."],"published-print":{"date-parts":[[2014,12]]},"DOI":"10.1109\/tamd.2014.2362682","type":"journal-article","created":{"date-parts":[[2014,12,24]],"date-time":"2014-12-24T18:29:58Z","timestamp":1419445798000},"page":"286-297","source":"Crossref","is-referenced-by-count":8,"title":["Optimal Rewards for Cooperative Agents"],"prefix":"10.1109","volume":"6","author":[{"given":"Bingyao","family":"Liu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Satinder","family":"Singh","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Richard L.","family":"Lewis","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shiyin","family":"Qin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","article-title":"Policy invariance under reward transformations: Theory and application to reward shaping","author":"ng","year":"1999","journal-title":"Proc Int Conf Machine Learning (ICML)"},{"key":"ref11","author":"skinner","year":"1938","journal-title":"The Behavior of Organisms An Experimental Analysis"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.1991.170605"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CEC.1999.785467"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/DEVLRN.2007.4354030"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.3389\/neuro.12.006.2007"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TEVC.2006.890271"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TAMD.2009.2037513"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TAMD.2010.2103311"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TAMD.2010.2050205"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1023\/A:1013689704352"},{"key":"ref4","article-title":"Characterizing EVOI-sufficient k-response query sets in decision problems","author":"cohn","year":"2014","journal-title":"12th Int Conf Artif Intell Stat (AISTATS)"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1007\/11871842_29"},{"key":"ref3","article-title":"Making rational decisions using adaptive utility elicitation","author":"chajewska","year":"2000","journal-title":"Natl Conf Artificial Intelligence (AAAI)"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1145\/1538788.1538812"},{"key":"ref29","article-title":"Reward design via online gradient ascent","author":"sorg","year":"2010","journal-title":"Adv Neural Inf Process Syst (NIPS)"},{"key":"ref5","article-title":"Algorithms for inverse reinforcement learning","author":"ng","year":"2000","journal-title":"Proc Int Conf Machine Learning (ICML)"},{"key":"ref8","first-page":"12","article-title":"Robot learning from demonstration","author":"atkeson","year":"1997","journal-title":"Proc 14th Int Conf Mach Learn"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/MRA.2010.936952"},{"key":"ref2","article-title":"Internal rewards mitigate agent boundedness","author":"sorg","year":"2010","journal-title":"Proc Int Conf Machine Learning (ICML)"},{"key":"ref9","article-title":"A ?neural? network that learns to play backgammon","author":"tesauro","year":"1987","journal-title":"Neural Inf Process Syst (NIPS)"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TAMD.2010.2051031"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TAMD.2010.2051436"},{"key":"ref22","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v25i1.7931","article-title":"Optimal rewards versus leaf-evaluation heuristics in planning agents","author":"sorg","year":"2011","journal-title":"AAAI Conf on Artificial Intelligence"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TAMD.2012.2208457"},{"key":"ref24","article-title":"An MDP-based approach to online mechanism design","author":"parkes","year":"2003","journal-title":"Proc 17th Annu Conf Neural Inf Process Syst (NIPS)"},{"key":"ref23","article-title":"Collective intelligence","author":"wolpert","year":"1999","journal-title":"4th Workshop Econ Heterogeneous Interacting Agents"},{"key":"ref26","article-title":"Strong mitigation: Nesting search for good policies within search for good reward","author":"bratman","year":"2012","journal-title":"24th Int Conf on Autonomous Agents and Multiagent Systems (AAMAS"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/DEVLRN.2011.6037325"}],"container-title":["IEEE Transactions on Autonomous Mental Development"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/4563672\/6983639\/06920028.pdf?arnumber=6920028","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,7,31]],"date-time":"2023-07-31T04:02:43Z","timestamp":1690776163000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/6920028\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2014,12]]},"references-count":29,"journal-issue":{"issue":"4"},"URL":"https:\/\/doi.org\/10.1109\/tamd.2014.2362682","relation":{},"ISSN":["1943-0604","1943-0612"],"issn-type":[{"value":"1943-0604","type":"print"},{"value":"1943-0612","type":"electronic"}],"subject":[],"published":{"date-parts":[[2014,12]]}}}