{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,8]],"date-time":"2026-05-08T16:38:59Z","timestamp":1778258339177,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":37,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,10,17]],"date-time":"2021-10-17T00:00:00Z","timestamp":1634428800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Shandong Provincial Key Research and Development Program","award":["2019JZZY010119"],"award-info":[{"award-number":["2019JZZY010119"]}]},{"name":"Key Research Program of Frontier Sciences CAS Grant","award":["ZDBS-LY-JSC032"],"award-info":[{"award-number":["ZDBS-LY-JSC032"]}]},{"name":"National Key Research and Development Program of China Grant","award":["2018AAA0100400"],"award-info":[{"award-number":["2018AAA0100400"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61525306, 61633021, 61721004, 61806194, U1803261, and 61976132"],"award-info":[{"award-number":["61525306, 61633021, 61721004, 61806194, U1803261, and 61976132"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100005090","name":"Beijing Nova Program","doi-asserted-by":"publisher","award":["Z201100006820079"],"award-info":[{"award-number":["Z201100006820079"]}],"id":[{"id":"10.13039\/501100005090","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,10,17]]},"DOI":"10.1145\/3474085.3475282","type":"proceedings-article","created":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T17:45:27Z","timestamp":1634579127000},"page":"5101-5109","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":66,"title":["Neighbor-view Enhanced Model for Vision and Language Navigation"],"prefix":"10.1145","author":[{"given":"Dong","family":"An","sequence":"first","affiliation":[{"name":"Institute of Automation, Chinese Academy of Sciences &amp; University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuankai","family":"Qi","sequence":"additional","affiliation":[{"name":"University of Adelaide, Adelaide, SA, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yan","family":"Huang","sequence":"additional","affiliation":[{"name":"Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qi","family":"Wu","sequence":"additional","affiliation":[{"name":"University of Adelaide, Adelaide, SA, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liang","family":"Wang","sequence":"additional","affiliation":[{"name":"Institute of Automation, Chinese Academy of Sciences, CEBSIT, &amp; CAS-AIR, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tieniu","family":"Tan","sequence":"additional","affiliation":[{"name":"Institute of Automation, Chinese Academy of Sciences &amp; CEBSIT, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2021,10,17]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 3674--3683","author":"Anderson Peter","unstructured":"Peter Anderson , Qi Wu , Damien Teney , Jake Bruce , Mark Johnson , Niko S\u00fcnderhauf , Ian Reid , Stephen Gould , and Anton van den Hengel. 2018. Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments . In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 3674--3683 . Peter Anderson, Qi Wu, Damien Teney, Jake Bruce, Mark Johnson, Niko S\u00fcnderhauf, Ian Reid, Stephen Gould, and Anton van den Hengel. 2018. Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 3674--3683."},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/3DV.2017.00081"},{"key":"e_1_3_2_1_3_1","volume-title":"Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems","author":"Deng Zhiwei","year":"2020","unstructured":"Zhiwei Deng , Karthik Narasimhan , and Olga Russakovsky . 2020. Evolving Graphical Planner: Contextual Global Planning for Vision-and-Language Navigation . In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020 , NeurIPS 2020, December 6--12, 2020, virtual . Zhiwei Deng, Karthik Narasimhan, and Olga Russakovsky. 2020. Evolving Graphical Planner: Contextual Global Planning for Vision-and-Language Navigation. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020, NeurIPS 2020, December 6--12, 2020, virtual ."},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.5555\/3327144.3327251"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01315"},{"key":"e_1_3_2_1_6_1","volume-title":"Deep Residual Learning for Image Recognition. In 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR","author":"He Kaiming","year":"2016","unstructured":"Kaiming He , Xiangyu Zhang , Shaoqing Ren , and Jian Sun . 2016 . Deep Residual Learning for Image Recognition. In 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016. 770--778. Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In 2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016. 770--778."},{"key":"e_1_3_2_1_7_1","volume-title":"Language and Visual Entity Relationship Graph for Agent Navigation. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020","author":"Hong Yicong","year":"2020","unstructured":"Yicong Hong , Cristian Rodriguez Opazo , Yuankai Qi , Qi Wu , and Stephen Gould . 2020 a . Language and Visual Entity Relationship Graph for Agent Navigation. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020 , NeurIPS 2020 . Yicong Hong, Cristian Rodriguez Opazo, Yuankai Qi, Qi Wu, and Stephen Gould. 2020 a. Language and Visual Entity Relationship Graph for Agent Navigation. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020, NeurIPS 2020 ."},{"key":"e_1_3_2_1_8_1","volume-title":"Cristian Rodriguez Opazo, and Stephen Gould. 2020 b. A Recurrent Vision-and-Language BERT for Navigation. CoRR","author":"Hong Yicong","year":"2020","unstructured":"Yicong Hong , Qi Wu , Yuankai Qi , Cristian Rodriguez Opazo, and Stephen Gould. 2020 b. A Recurrent Vision-and-Language BERT for Navigation. CoRR , Vol. abs\/ 2011 .13922 ( 2020 ). Yicong Hong, Qi Wu, Yuankai Qi, Cristian Rodriguez Opazo, and Stephen Gould. 2020 b. A Recurrent Vision-and-Language BERT for Navigation. CoRR, Vol. abs\/2011.13922 (2020)."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P19-1655"},{"key":"e_1_3_2_1_10_1","volume-title":"Language-Conditioned Graph Networks for Relational Reasoning. In 2019 IEEE\/CVF International Conference on Computer Vision, ICCV","author":"Hu Ronghang","year":"2019","unstructured":"Ronghang Hu , Anna Rohrbach , Trevor Darrell , and Kate Saenko . 2019 b . Language-Conditioned Graph Networks for Relational Reasoning. In 2019 IEEE\/CVF International Conference on Computer Vision, ICCV 2019. 10293--10302. Ronghang Hu, Anna Rohrbach, Trevor Darrell, and Kate Saenko. 2019 b. Language-Conditioned Graph Networks for Relational Reasoning. In 2019 IEEE\/CVF International Conference on Computer Vision, ICCV 2019. 10293--10302."},{"key":"e_1_3_2_1_11_1","volume-title":"NeurIPS 2019 Workshop .","author":"Ilharco Gabriel","year":"2019","unstructured":"Gabriel Ilharco , Vihan Jain , Alexander Ku , Eugene Ie , and Jason Baldridge . 2019 . General Evaluation for Instruction Conditioned Navigation using Dynamic Time Warping. In Visually Grounded Interaction and Language (ViGIL) , NeurIPS 2019 Workshop . Gabriel Ilharco, Vihan Jain, Alexander Ku, Eugene Ie, and Jason Baldridge. 2019. General Evaluation for Instruction Conditioned Navigation using Dynamic Time Warping. In Visually Grounded Interaction and Language (ViGIL), NeurIPS 2019 Workshop ."},{"key":"e_1_3_2_1_12_1","volume-title":"Alexander Ku, Ashish Vaswani, Eugene Ie, and Jason Baldridge.","author":"Jain Vihan","year":"2019","unstructured":"Vihan Jain , Gabriel Magalh a es , Alexander Ku, Ashish Vaswani, Eugene Ie, and Jason Baldridge. 2019 . Stay on the Path : Instruction Fidelity in Vision-and-Language Navigation. In Proceedings of the 57th Conference of the Association for Computational Linguistics , ACL 2019. 1862--1872. Vihan Jain, Gabriel Magalh a es, Alexander Ku, Ashish Vaswani, Eugene Ie, and Jason Baldridge. 2019. Stay on the Path: Instruction Fidelity in Vision-and-Language Navigation. In Proceedings of the 57th Conference of the Association for Computational Linguistics, ACL 2019. 1862--1872."},{"key":"e_1_3_2_1_13_1","volume-title":"Computer Vision - ECCV 2020 - 16th European Conference. 104--120.","author":"Krantz Jacob","unstructured":"Jacob Krantz , Erik Wijmans , Arjun Majumdar , Dhruv Batra , and Stefan Lee . 2020. Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments . In Computer Vision - ECCV 2020 - 16th European Conference. 104--120. Jacob Krantz, Erik Wijmans, Arjun Majumdar, Dhruv Batra, and Stefan Lee. 2020. Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments. In Computer Vision - ECCV 2020 - 16th European Conference. 104--120."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"e_1_3_2_1_15_1","volume-title":"Embodied Vision-and-Language Navigation with Dynamic Convolutional Filters. In 30th British Machine Vision Conference 2019, BMVC 2019","author":"Landi Federico","year":"2019","unstructured":"Federico Landi , Lorenzo Baraldi , Massimiliano Corsini , and Rita Cucchiara . 2019 . Embodied Vision-and-Language Navigation with Dynamic Convolutional Filters. In 30th British Machine Vision Conference 2019, BMVC 2019 , Cardiff, UK, September 9--12 , 2019. 18. Federico Landi, Lorenzo Baraldi, Massimiliano Corsini, and Rita Cucchiara. 2019. Embodied Vision-and-Language Navigation with Dynamic Convolutional Filters. In 30th British Machine Vision Conference 2019, BMVC 2019, Cardiff, UK, September 9--12, 2019. 18."},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1159"},{"key":"e_1_3_2_1_17_1","volume-title":"7th International Conference on Learning Representations, ICLR 2019 .","author":"Ma Chih-Yao","year":"2019","unstructured":"Chih-Yao Ma , Jiasen Lu , Zuxuan Wu , Ghassan AlRegib , Zsolt Kira , Richard Socher , and Caiming Xiong . 2019 a. Self-Monitoring Navigation Agent via Auxiliary Progress Estimation . In 7th International Conference on Learning Representations, ICLR 2019 . Chih-Yao Ma, Jiasen Lu, Zuxuan Wu, Ghassan AlRegib, Zsolt Kira, Richard Socher, and Caiming Xiong. 2019 a. Self-Monitoring Navigation Agent via Auxiliary Progress Estimation. In 7th International Conference on Learning Representations, ICLR 2019 ."},{"key":"e_1_3_2_1_18_1","volume-title":"The Regretful Agent: Heuristic-Aided Navigation Through Progress Estimation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR","author":"Ma Chih-Yao","year":"2019","unstructured":"Chih-Yao Ma , Zuxuan Wu , Ghassan AlRegib , Caiming Xiong , and Zsolt Kira . 2019 b . The Regretful Agent: Heuristic-Aided Navigation Through Progress Estimation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019. 6732--6740. Chih-Yao Ma, Zuxuan Wu, Ghassan AlRegib, Caiming Xiong, and Zsolt Kira. 2019 b. The Regretful Agent: Heuristic-Aided Navigation Through Progress Estimation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019. 6732--6740."},{"key":"e_1_3_2_1_19_1","volume-title":"Computer Vision - ECCV 2020 - 16th European Conference. 259--274.","author":"Majumdar Arjun","unstructured":"Arjun Majumdar , Ayush Shrivastava , Stefan Lee , Peter Anderson , Devi Parikh , and Dhruv Batra . 2020. Improving Vision-and-Language Navigation with Image-Text Pairs from the Web . In Computer Vision - ECCV 2020 - 16th European Conference. 259--274. Arjun Majumdar, Ayush Shrivastava, Stefan Lee, Peter Anderson, Devi Parikh, and Dhruv Batra. 2020. Improving Vision-and-Language Navigation with Image-Text Pairs from the Web. In Computer Vision - ECCV 2020 - 16th European Conference. 259--274."},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.5555\/3045390.3045594"},{"key":"e_1_3_2_1_21_1","volume-title":"Local-Global Video-Text Interactions for Temporal Grounding. In 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR","author":"Mun Jonghwan","year":"2020","unstructured":"Jonghwan Mun , Minsu Cho , and Bohyung Han . 2020 . Local-Global Video-Text Interactions for Temporal Grounding. In 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020. 10807--10816. Jonghwan Mun, Minsu Cho, and Bohyung Han. 2020. Local-Global Video-Text Interactions for Temporal Grounding. In 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020. 10807--10816."},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1063"},{"key":"e_1_3_2_1_23_1","volume-title":"Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing, EMNLP 2014. 1532--1543","author":"Pennington Jeffrey","unstructured":"Jeffrey Pennington , Richard Socher , and Christopher D. Manning . 2014. Glove: Global Vectors for Word Representation . In Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing, EMNLP 2014. 1532--1543 . Jeffrey Pennington, Richard Socher, and Christopher D. Manning. 2014. Glove: Global Vectors for Word Representation. In Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing, EMNLP 2014. 1532--1543."},{"key":"e_1_3_2_1_24_1","volume-title":"Computer Vision - ECCV 2020 - 16th European Conference. 303--317.","author":"Qi Yuankai","unstructured":"Yuankai Qi , Zizheng Pan , Shengping Zhang , Anton van den Hengel , and Qi Wu . 2020 a. Object-and-Action Aware Model for Visual Language Navigation . In Computer Vision - ECCV 2020 - 16th European Conference. 303--317. Yuankai Qi, Zizheng Pan, Shengping Zhang, Anton van den Hengel, and Qi Wu. 2020 a. Object-and-Action Aware Model for Visual Language Navigation. In Computer Vision - ECCV 2020 - 16th European Conference. 303--317."},{"key":"e_1_3_2_1_25_1","volume-title":"REVERIE: Remote Embodied Visual Referring Expression in Real Indoor Environments. In 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR","author":"Qi Yuankai","year":"2020","unstructured":"Yuankai Qi , Qi Wu , Peter Anderson , Xin Wang , William Yang Wang , Chunhua Shen , and Anton van den Hengel. 2020 b . REVERIE: Remote Embodied Visual Referring Expression in Real Indoor Environments. In 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020 . 9979--9988. Yuankai Qi, Qi Wu, Peter Anderson, Xin Wang, William Yang Wang, Chunhua Shen, and Anton van den Hengel. 2020 b. REVERIE: Remote Embodied Visual Referring Expression in Real Indoor Environments. In 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020. 9979--9988."},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.5555\/2969239.2969250"},{"key":"e_1_3_2_1_27_1","volume-title":"An overview of gradient descent optimization algorithms. CoRR","author":"Ruder Sebastian","year":"2016","unstructured":"Sebastian Ruder . 2016. An overview of gradient descent optimization algorithms. CoRR , Vol. abs\/ 1609 .04747 ( 2016 ). Sebastian Ruder. 2016. An overview of gradient descent optimization algorithms. CoRR, Vol. abs\/1609.04747 (2016)."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N19-1268"},{"key":"e_1_3_2_1_29_1","volume-title":"Vision-and-Dialog Navigation. In 3rd Annual Conference on Robot Learning, CoRL","author":"Thomason Jesse","year":"2019","unstructured":"Jesse Thomason , Michael Murray , Maya Cakmak , and Luke Zettlemoyer . 2019 . Vision-and-Dialog Navigation. In 3rd Annual Conference on Robot Learning, CoRL 2019. 394--406. Jesse Thomason, Michael Murray, Maya Cakmak, and Luke Zettlemoyer. 2019. Vision-and-Dialog Navigation. In 3rd Annual Conference on Robot Learning, CoRL 2019. 394--406."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.5555\/3295222.3295349"},{"key":"e_1_3_2_1_31_1","volume-title":"Proceedings, Part IX. 126--141","author":"Wang Hu","year":"2020","unstructured":"Hu Wang , Qi Wu , and Chunhua Shen . 2020 b. Soft Expert Reward Learning for Vision-and-Language Navigation. In Computer Vision - ECCV 2020 - 16th European Conference, Glasgow, UK, August 23--28, 2020 , Proceedings, Part IX. 126--141 . Hu Wang, Qi Wu, and Chunhua Shen. 2020 b. Soft Expert Reward Learning for Vision-and-Language Navigation. In Computer Vision - ECCV 2020 - 16th European Conference, Glasgow, UK, August 23--28, 2020, Proceedings, Part IX. 126--141."},{"key":"e_1_3_2_1_32_1","volume-title":"Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR","author":"Wang Xin","year":"2019","unstructured":"Xin Wang , Qiuyuan Huang , Asli Celikyilmaz , Jianfeng Gao , Dinghan Shen , Yuan-Fang Wang , William Yang Wang , and Lei Zhang . 2019 . Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019. 6629--6638. Xin Wang, Qiuyuan Huang, Asli Celikyilmaz, Jianfeng Gao, Dinghan Shen, Yuan-Fang Wang, William Yang Wang, and Lei Zhang. 2019. Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation. In IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2019. 6629--6638."},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01270-0_3"},{"key":"e_1_3_2_1_34_1","volume-title":"Proceedings, Part XXIV. 413--430","author":"Wang Xin Eric","year":"2020","unstructured":"Xin Eric Wang , Vihan Jain , Eugene Ie , William Yang Wang , Zornitsa Kozareva , and Sujith Ravi . 2020 a. Environment-Agnostic Multitask Learning for Natural Language Grounded Navigation. In Computer Vision - ECCV 2020 - 16th European Conference, Glasgow, UK, August 23--28, 2020 , Proceedings, Part XXIV. 413--430 . Xin Eric Wang, Vihan Jain, Eugene Ie, William Yang Wang, Zornitsa Kozareva, and Sujith Ravi. 2020 a. Environment-Agnostic Multitask Learning for Natural Language Grounded Navigation. In Computer Vision - ECCV 2020 - 16th European Conference, Glasgow, UK, August 23--28, 2020, Proceedings, Part XXIV. 413--430."},{"key":"e_1_3_2_1_35_1","volume-title":"MAttNet: Modular Attention Network for Referring Expression Comprehension. In 2018 IEEE Conference on Computer Vision and Pattern Recognition, CVPR","author":"Yu Licheng","year":"2018","unstructured":"Licheng Yu , Zhe Lin , Xiaohui Shen , Jimei Yang , Xin Lu , Mohit Bansal , and Tamara L. Berg . 2018 . MAttNet: Modular Attention Network for Referring Expression Comprehension. In 2018 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2018 . 1307--1315. Licheng Yu, Zhe Lin, Xiaohui Shen, Jimei Yang, Xin Lu, Mohit Bansal, and Tamara L. Berg. 2018. MAttNet: Modular Attention Network for Referring Expression Comprehension. In 2018 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2018. 1307--1315."},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2723009"},{"key":"e_1_3_2_1_37_1","volume-title":"Vision-Language Navigation With Self-Supervised Auxiliary Reasoning Tasks. In 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR","author":"Zhu Fengda","year":"2020","unstructured":"Fengda Zhu , Yi Zhu , Xiaojun Chang , and Xiaodan Liang . 2020 . Vision-Language Navigation With Self-Supervised Auxiliary Reasoning Tasks. In 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020. 10009--10019. Fengda Zhu, Yi Zhu, Xiaojun Chang, and Xiaodan Liang. 2020. Vision-Language Navigation With Self-Supervised Auxiliary Reasoning Tasks. In 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2020. 10009--10019."}],"event":{"name":"MM '21: ACM Multimedia Conference","location":"Virtual Event China","acronym":"MM '21","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 29th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475282","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3474085.3475282","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:48:17Z","timestamp":1750193297000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475282"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,17]]},"references-count":37,"alternative-id":["10.1145\/3474085.3475282","10.1145\/3474085"],"URL":"https:\/\/doi.org\/10.1145\/3474085.3475282","relation":{},"subject":[],"published":{"date-parts":[[2021,10,17]]},"assertion":[{"value":"2021-10-17","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}