{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,4]],"date-time":"2025-09-04T13:43:36Z","timestamp":1756993416113,"version":"3.28.0"},"reference-count":41,"publisher":"IEEE","license":[{"start":{"date-parts":[[2022,10,23]],"date-time":"2022-10-23T00:00:00Z","timestamp":1666483200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2022,10,23]],"date-time":"2022-10-23T00:00:00Z","timestamp":1666483200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022,10,23]]},"DOI":"10.1109\/iros47612.2022.9981261","type":"proceedings-article","created":{"date-parts":[[2022,12,26]],"date-time":"2022-12-26T19:38:15Z","timestamp":1672083495000},"page":"5877-5884","source":"Crossref","is-referenced-by-count":7,"title":["Learning to Act with Affordance-Aware Multimodal Neural SLAM"],"prefix":"10.1109","author":[{"given":"Zhiwei","family":"Jia","sequence":"first","affiliation":[{"name":"University of California,San Diego"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kaixiang","family":"Lin","sequence":"additional","affiliation":[{"name":"Amazon Alexa AI"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yizhou","family":"Zhao","sequence":"additional","affiliation":[{"name":"University of California,Los Angeles"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qiaozi","family":"Gao","sequence":"additional","affiliation":[{"name":"Amazon Alexa AI"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Govind","family":"Thattai","sequence":"additional","affiliation":[{"name":"Amazon Alexa AI"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gaurav S.","family":"Sukhatme","sequence":"additional","affiliation":[{"name":"Amazon Alexa AI"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"doi-asserted-by":"publisher","key":"ref1","DOI":"10.1109\/ICCV48922.2021.01564"},{"doi-asserted-by":"publisher","key":"ref2","DOI":"10.18653\/v1\/2021.findings-acl.368"},{"key":"ref3","first-page":"706","article-title":"A persistent spa-tial semantic representation for high-level natural language instruction execution","volume-title":"Conference on Robot Learning. PMLR","author":"Blukis"},{"key":"ref4","first-page":"2005","article-title":"Learning affordance landscapes for interaction exploration in 3d environments","volume-title":"Advances in Neural Information Processing Systems","volume":"33","author":"Nagarajan","year":"2020"},{"doi-asserted-by":"publisher","key":"ref5","DOI":"10.1109\/ICCV48922.2021.00190"},{"key":"ref6","article-title":"Em-bodied bert: A transformer model for embodied, language-guided vi-sual task completion","author":"Suglia","year":"2021","journal-title":"Learning-to-Learn through Interaction (NILLI) workshop, EMNLP"},{"doi-asserted-by":"publisher","key":"ref7","DOI":"10.1109\/CVPR.2018.00387"},{"key":"ref8","first-page":"1","article-title":"Em-bodied question answering","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","author":"Das"},{"doi-asserted-by":"publisher","key":"ref9","DOI":"10.1109\/CVPR.2019.01282"},{"doi-asserted-by":"publisher","key":"ref10","DOI":"10.1109\/CVPR42600.2020.01075"},{"volume-title":"International Conference on Learning Representations","author":"Chen","article-title":"Learning exploration policies for navigation","key":"ref11"},{"doi-asserted-by":"publisher","key":"ref12","DOI":"10.24963\/ijcai.2021\/128"},{"volume-title":"The International Conference on Learning Representations (ICLR)","author":"Chaplot","article-title":"Learning to explore using active neural slam","key":"ref13"},{"doi-asserted-by":"publisher","key":"ref14","DOI":"10.1109\/CVPR42600.2020.01289"},{"doi-asserted-by":"publisher","key":"ref15","DOI":"10.1109\/IROS.2015.7354029"},{"key":"ref16","article-title":"Learning to move with affordance maps","volume-title":"International Conference on Learning Representations","author":"Qi","year":"2019"},{"doi-asserted-by":"publisher","key":"ref17","DOI":"10.1007\/s11263-021-01437-z"},{"key":"ref18","article-title":"Ai2-thor: An interactive 3d environment for visual ai","author":"Kolve","year":"2017","journal-title":"arXiv preprint"},{"key":"ref19","article-title":"Igibson 2.0: Object-centric simulation for robot learning of everyday household tasks","author":"Li","year":"2021","journal-title":"arXiv preprint"},{"doi-asserted-by":"publisher","key":"ref20","DOI":"10.1109\/ICCV.2019.00943"},{"key":"ref21","article-title":"Threedworld: A platform for interactive multi-modal physical simulation","author":"Gan","year":"2020","journal-title":"arXiv preprint"},{"doi-asserted-by":"publisher","key":"ref22","DOI":"10.1109\/CVPR.2018.00886"},{"key":"ref23","article-title":"Object goal navigation using goal-oriented semantic exploration","volume":"33","author":"Chaplot","year":"2020","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref24","first-page":"1484","article-title":"Differentiable spatial planning using transformers","volume-title":"International Conference on Machine Learning. PMLR","author":"Chaplot"},{"key":"ref25","article-title":"Deep affordance foresight: Planning through what can be done in the future","author":"Xu","year":"2020","journal-title":"arXiv preprint"},{"key":"ref26","article-title":"Film: Following instructions in language with modular methods","author":"Min","year":"2021","journal-title":"arXiv preprint"},{"doi-asserted-by":"publisher","key":"ref27","DOI":"10.1109\/CVPR.2018.00135"},{"doi-asserted-by":"publisher","key":"ref28","DOI":"10.1109\/IJCNN.1991.170605"},{"doi-asserted-by":"publisher","key":"ref29","DOI":"10.1109\/CVPRW.2017.70"},{"key":"ref30","article-title":"Large-scale study of curiosity-driven learning","author":"Burda","year":"2018","journal-title":"arXiv preprint"},{"key":"ref31","first-page":"1956","article-title":"Guiding reinforcement learning exploration using natural language","volume-title":"Proceedings of the 17th International Conference on Autonomous Agents and MultiAgent Systems","author":"Harrison"},{"key":"ref32","first-page":"1","article-title":"# exploration: A study of count-based exploration for deep reinforcement learning","volume-title":"31st Conference on Neural Information Processing Systems (NIPS)","volume":"30","author":"Tang"},{"key":"ref33","first-page":"1471","article-title":"Unifying count-based exploration and intrinsic motivation","volume":"29","author":"Bellemare","year":"2016","journal-title":"Advances in neural information processing systems"},{"key":"ref34","first-page":"2721","article-title":"Count-based exploration with neural density models","volume-title":"International conference on machine learning. PMLR","author":"Ostrovski"},{"key":"ref35","article-title":"Optimistic exploration even with a pessimistic initialisation","author":"Rashid","year":"2020","journal-title":"arXiv preprint"},{"doi-asserted-by":"publisher","key":"ref36","DOI":"10.1109\/ICCV.2017.322"},{"key":"ref37","first-page":"5998","article-title":"Attention is all you need","author":"Vaswani","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref38","first-page":"2017","article-title":"Spatial transformer networks","volume":"28","author":"Jaderberg","year":"2015","journal-title":"Advances in neural information processing systems"},{"doi-asserted-by":"publisher","key":"ref39","DOI":"10.5121\/csit.2019.91713"},{"key":"ref40","article-title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","author":"Lu","year":"2019","journal-title":"arXiv preprint"},{"key":"ref41","article-title":"Agent with the big picture: Perceiving surroundings for interactive instruction following","author":"Kim","year":"2021","journal-title":"Embodied AI Workshop CVPR"}],"event":{"name":"2022 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","start":{"date-parts":[[2022,10,23]]},"location":"Kyoto, Japan","end":{"date-parts":[[2022,10,27]]}},"container-title":["2022 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9981026\/9981028\/09981261.pdf?arnumber=9981261","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,2,1]],"date-time":"2024-02-01T03:43:07Z","timestamp":1706758987000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9981261\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,23]]},"references-count":41,"URL":"https:\/\/doi.org\/10.1109\/iros47612.2022.9981261","relation":{},"subject":[],"published":{"date-parts":[[2022,10,23]]}}}