{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,11]],"date-time":"2026-06-11T15:54:02Z","timestamp":1781193242158,"version":"3.54.1"},"reference-count":79,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2017YFA0700904"],"award-info":[{"award-number":["2017YFA0700904"]}]},{"name":"National Key Research and Development Program of China","award":["2020AAA0106000"],"award-info":[{"award-number":["2020AAA0106000"]}]},{"name":"National Key Research and Development Program of China","award":["2020AAA0104304"],"award-info":[{"award-number":["2020AAA0104304"]}]},{"name":"National Key Research and Development Program of China","award":["2020AAA0106302"],"award-info":[{"award-number":["2020AAA0106302"]}]},{"name":"National Key Research and Development Program of China","award":["2021YFB2701000"],"award-info":[{"award-number":["2021YFB2701000"]}]},{"name":"NSFC Projects","award":["62061136001"],"award-info":[{"award-number":["62061136001"]}]},{"name":"NSFC Projects","award":["62106123"],"award-info":[{"award-number":["62106123"]}]},{"name":"NSFC Projects","award":["62076147"],"award-info":[{"award-number":["62076147"]}]},{"name":"NSFC Projects","award":["U19B2034"],"award-info":[{"award-number":["U19B2034"]}]},{"name":"NSFC Projects","award":["U1811461"],"award-info":[{"award-number":["U1811461"]}]},{"name":"NSFC Projects","award":["U19A2081"],"award-info":[{"award-number":["U19A2081"]}]},{"name":"NSFC Projects","award":["61972224"],"award-info":[{"award-number":["61972224"]}]},{"name":"Beijing NSF Project","award":["JQ19016"],"award-info":[{"award-number":["JQ19016"]}]},{"DOI":"10.13039\/501100017582","name":"Beijing National Research Center for Information Science and Technology","doi-asserted-by":"crossref","award":["BNR2023RC01004"],"award-info":[{"award-number":["BNR2023RC01004"]}],"id":[{"id":"10.13039\/501100017582","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Tsinghua Institute for Guoqiang, Beijing Academy of Artificial Intelligence"},{"DOI":"10.13039\/501100001809","name":"High Performance Computing Center, Tsinghua University","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. on Image Process."],"published-print":{"date-parts":[[2024]]},"DOI":"10.1109\/tip.2024.3459800","type":"journal-article","created":{"date-parts":[[2024,9,18]],"date-time":"2024-09-18T18:05:31Z","timestamp":1726682731000},"page":"5370-5381","source":"Crossref","is-referenced-by-count":9,"title":["To Boost Zero-Shot Generalization for Embodied Reasoning With Vision-Language Pre-Training"],"prefix":"10.1109","volume":"33","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8110-9486","authenticated-orcid":false,"given":"Ke","family":"Su","sequence":"first","affiliation":[{"name":"Department of Computer Science and Technology, Tsinghua-Bosch Joint ML Center, THBI Laboratory, BNRist Center, Institute for AI, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4012-3796","authenticated-orcid":false,"given":"Xingxing","family":"Zhang","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Technology, Tsinghua-Bosch Joint ML Center, THBI Laboratory, BNRist Center, Institute for AI, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Siyang","family":"Zhang","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Nankai University, Tianjin, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6254-2388","authenticated-orcid":false,"given":"Jun","family":"Zhu","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Technology, Tsinghua-Bosch Joint ML Center, THBI Laboratory, BNRist Center, Institute for AI, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bo","family":"Zhang","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Technology, Tsinghua-Bosch Joint ML Center, THBI Laboratory, BNRist Center, Institute for AI, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"On evaluation of embodied navigation agents","author":"Anderson","year":"2018","journal-title":"arXiv:1807.06757"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00008"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.215"},{"key":"ref4","first-page":"5296","article-title":"Counterfactual vision-and-language navigation: Unravelling the unseen","volume-title":"Proc. Adv. Neural Inf. Process. Syst., Annu. Conf. Neural Inf. Process. Syst. (NeurIPS)","author":"Parvaneh"},{"key":"ref5","article-title":"JARVIS: A neuro-symbolic commonsense reasoning framework for conversational embodied agents","author":"Zheng","year":"2022","journal-title":"arXiv:2208.13266"},{"key":"ref6","first-page":"1","article-title":"Visual semantic navigation using scene priors","volume-title":"Proc. 7th Int. Conf. Learn. Represent. (ICLR)","author":"Yang"},{"key":"ref7","first-page":"4132","article-title":"On the generalization of representations in reinforcement learning","volume-title":"Proc. Int. Conf. Artif. Intell. Statist. (AISTATS)","volume":"151","author":"Lan"},{"key":"ref8","first-page":"1","article-title":"Visual representation learning does not generalize strongly within the same domain","volume-title":"Proc. 10th Int. Conf. Learn. Represent. (ICLR)","author":"Schott"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01935"},{"key":"ref10","article-title":"Large language models are human-level prompt engineers","author":"Zhou","year":"2022","journal-title":"arXiv:2211.01910"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00756"},{"issue":"1","key":"ref12","first-page":"1","article-title":"A path towards autonomous machine intelligence","volume":"62","author":"LeCun","year":"2022","journal-title":"Open Review"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1007\/s11633-022-1410-8"},{"key":"ref14","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","volume":"139","author":"Radford"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01441"},{"key":"ref16","first-page":"23374","article-title":"How modular should neural module networks be for systematic generalization?","volume-title":"Proc. Adv. Neural Inf. Process. Syst., Annu. Conf. Neural Inf. Process. Syst. (NeurIPS)","author":"D\u2019Amario"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00682"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TETCI.2022.3141105"},{"key":"ref19","article-title":"From seeing to moving: A survey on learning for visual indoor navigation (VIN)","author":"Ye","year":"2020","journal-title":"arXiv:2002.11310"},{"key":"ref20","article-title":"AI2-THOR: An interactive 3D environment for visual AI","author":"Kolve","year":"2017","journal-title":"arXiv:1712.05474"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00943"},{"key":"ref22","first-page":"251","article-title":"Habitat 2.0: Training home assistants to rearrange their habitat","volume-title":"Proc. Adv. Neural Inf. Process. Syst., Annu. Conf. Neural Inf. Process. Syst. (NeurIPS)","author":"Szot"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/3DV.2017.00081"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2020.2965078"},{"key":"ref25","first-page":"1","article-title":"Habitat-matterport 3D dataset (HM3D): 1000 large-scale 3D environments for embodied AI","volume-title":"Proc. 35th Conf. Neural Inf. Process. Syst. Datasets Benchmarks Track (Round)","author":"Ramakrishnan"},{"key":"ref26","first-page":"1","article-title":"Building generalizable agents with a realistic and rich 3D environment","volume-title":"Proc. 6th Int. Conf. Learn. Represent. (ICLR)","author":"Wu"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-021-01437-z"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"ref29","article-title":"Comprehensive visual question answering on point clouds through compositional scene manipulation","author":"Yan","year":"2021","journal-title":"arXiv:2112.11691"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N19-1268"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TRO.2020.2994002"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00169"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1007\/s11633-022-1358-8"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2017.06.005"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2017.05.001"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.670"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-019-01786-4"},{"key":"ref39","article-title":"VQA and visual reasoning: An overview of recent datasets, methods and challenges","author":"Zakari","year":"2022","journal-title":"arXiv:2212.13296"},{"key":"ref40","article-title":"Neural module networks","author":"Andreas","year":"2015","journal-title":"arXiv:1511.02799"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P17-2034"},{"key":"ref42","article-title":"NLVR2 visual bias analysis","author":"Suhr","year":"2019","journal-title":"arXiv:1909.10411"},{"key":"ref43","first-page":"2953","article-title":"Exploring models and data for image question answering","volume-title":"Proc. NIPS","author":"Ren"},{"key":"ref44","first-page":"1","article-title":"Compositional attention networks for machine reasoning","volume-title":"Proc. 6th Int. Conf. Learn. Represent. (ICLR)","author":"Hudson"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2020.03.098"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/d16-1044"},{"key":"ref48","first-page":"1571","article-title":"Bilinear attention networks","volume-title":"Proc. NIPS","author":"Kim"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2817340"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.285"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11671"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2021.107408"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01389"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.12"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.93"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01234-2_4"},{"key":"ref57","first-page":"1","article-title":"The neuro-symbolic concept learner: Interpreting scenes, words, and sentences from natural supervision","volume-title":"Proc. 7th Int. Conf. Learn. Represent. (ICLR)","author":"Mao"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.2008.2005605"},{"key":"ref59","first-page":"1263","article-title":"Neural message passing for quantum chemistry","volume-title":"Proc. 34th Int. Conf. Mach. Learning","volume":"70","author":"Gilmer"},{"key":"ref60","article-title":"Relational inductive biases, deep learning, and graph networks","author":"Battaglia","year":"2018","journal-title":"arXiv:1806.01261"},{"key":"ref61","first-page":"1","article-title":"Graph attention networks","volume-title":"Proc. 6th Int. Conf. Learn. Represent. (ICLR)","author":"Velickovic"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1016\/j.aiopen.2021.01.001"},{"key":"ref63","article-title":"A survey on graph neural networks and graph transformers in computer vision: A task-oriented perspective","author":"Chen","year":"2022","journal-title":"arXiv:2209.13232"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.344"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00206"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.01039"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00504"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.01041"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01459"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3104937"},{"key":"ref71","article-title":"Scene graph reasoning for visual question answering","author":"Hildebrandt","year":"2020","journal-title":"arXiv:2007.01072"},{"key":"ref72","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018","journal-title":"arXiv:1810.04805"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.7551\/mitpress\/7503.003.0022"},{"key":"ref74","first-page":"1","article-title":"Learning bounds for domain adaptation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"20","author":"Blitzer"},{"key":"ref75","first-page":"4967","article-title":"A simple neural network module for relational reasoning","volume-title":"Proc. NIPS","author":"Santoro"},{"key":"ref76","article-title":"Transfer learning in visual and relational reasoning","author":"Jayram","year":"2019","journal-title":"arXiv:1911.11938"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.325"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00857"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00519"}],"container-title":["IEEE Transactions on Image Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/83\/10346232\/10684038.pdf?arnumber=10684038","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,3]],"date-time":"2024-10-03T17:28:59Z","timestamp":1727976539000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10684038\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"references-count":79,"URL":"https:\/\/doi.org\/10.1109\/tip.2024.3459800","relation":{},"ISSN":["1057-7149","1941-0042"],"issn-type":[{"value":"1057-7149","type":"print"},{"value":"1941-0042","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024]]}}}