{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,8]],"date-time":"2026-05-08T16:39:00Z","timestamp":1778258340740,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":77,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,10,26]],"date-time":"2023-10-26T00:00:00Z","timestamp":1698278400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,10,26]]},"DOI":"10.1145\/3581783.3611736","type":"proceedings-article","created":{"date-parts":[[2023,10,27]],"date-time":"2023-10-27T07:27:40Z","timestamp":1698391660000},"page":"4349-4358","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":14,"title":["Mind the Gap: Improving Success Rate of Vision-and-Language Navigation by Revisiting Oracle Success Routes"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2942-1218","authenticated-orcid":false,"given":"Chongyang","family":"Zhao","sequence":"first","affiliation":[{"name":"The University of Adelaide, Adelaide, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4312-5682","authenticated-orcid":false,"given":"Yuankai","family":"Qi","sequence":"additional","affiliation":[{"name":"The University of Adelaide, Adelaide, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3631-256X","authenticated-orcid":false,"given":"Qi","family":"Wu","sequence":"additional","affiliation":[{"name":"The University of Adelaide, Adelaide, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2023,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Neighbor-view Enhanced Model for Vision and Language Navigation. In ACM Int. Conf. Multimedia.","author":"An Dong","year":"2021","unstructured":"Dong An, Yuankai Qi, Yan Huang, Qi Wu, Liang Wang, and Tieniu Tan. 2021. Neighbor-view Enhanced Model for Vision and Language Navigation. In ACM Int. Conf. Multimedia."},{"key":"e_1_3_2_1_2_1","volume-title":"BEVBert: Topo-Metric Map Pre-training for Language-guided Navigation. arXiv preprint arXiv:2212.04385","author":"An Dong","year":"2022","unstructured":"Dong An, Yuankai Qi, Yangguang Li, Yan Huang, Liang Wang, Tieniu Tan, and Jing Shao. 2022. BEVBert: Topo-Metric Map Pre-training for Language-guided Navigation. arXiv preprint arXiv:2212.04385 (2022)."},{"key":"e_1_3_2_1_3_1","volume-title":"Vision-and-Language Navigation: Interpreting Visually-Grounded Navigation Instructions in Real Environments. In IEEE Conf. Comput. Vis. Pattern Recog. 3674--3683","author":"Anderson Peter","unstructured":"Peter Anderson, Qi Wu, Damien Teney, Jake Bruce, Mark Johnson, Niko S\u00fc nderhauf, Ian D. Reid, Stephen Gould, and Anton van den Hengel. 2018. Vision-and-Language Navigation: Interpreting Visually-Grounded Navigation Instructions in Real Environments. In IEEE Conf. Comput. Vis. Pattern Recog. 3674--3683."},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/3DV.2017.00081"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"crossref","unstructured":"Jingyuan Chen Xinpeng Chen Lin Ma Zequn Jie and Tat-Seng Chua. 2018. Temporally grounding natural sentence in video. In EMNLP. 162--171.","DOI":"10.18653\/v1\/D18-1015"},{"key":"e_1_3_2_1_7_1","volume-title":"Reinforced Structured State-Evolution for Vision-Language Navigation. In IEEE Conf. Comput. Vis. Pattern Recog. 15450--15459","author":"Chen Jinyu","year":"2022","unstructured":"Jinyu Chen, Chen Gao, Erli Meng, Qiong Zhang, and Si Liu. 2022a. Reinforced Structured State-Evolution for Vision-Language Navigation. In IEEE Conf. Comput. Vis. Pattern Recog. 15450--15459."},{"key":"e_1_3_2_1_8_1","first-page":"5834","article-title":"History aware multimodal transformer for vision-and-language navigation","volume":"34","author":"Chen Shizhe","year":"2021","unstructured":"Shizhe Chen, Pierre-Louis Guhur, Cordelia Schmid, and Ivan Laptev. 2021. History aware multimodal transformer for vision-and-language navigation. Adv. Neural Inform. Process. Syst., Vol. 34 (2021), 5834--5847.","journal-title":"Adv. Neural Inform. Process. Syst."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19842-7_37"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01604"},{"key":"e_1_3_2_1_11_1","volume-title":"Learning Disentanglement with Decoupled Labels for Vision-Language Navigation. In Eur. Conf. Comput. Vis. 309--329","author":"Cheng Wenhao","year":"2022","unstructured":"Wenhao Cheng, Xingping Dong, Salman H. Khan, and Jianbing Shen. 2022. Learning Disentanglement with Decoupled Labels for Vision-Language Navigation. In Eur. Conf. Comput. Vis. 309--329."},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3023438"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00179"},{"key":"e_1_3_2_1_14_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT. 4171--4186.","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT. 4171--4186."},{"key":"e_1_3_2_1_15_1","volume-title":"Int. Conf. Learn. Represent.","author":"Dosovitskiy Alexey","year":"2021","unstructured":"Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. In Int. Conf. Learn. Represent."},{"key":"e_1_3_2_1_16_1","unstructured":"Daniel Fried Ronghang Hu Volkan Cirik Anna Rohrbach Jacob Andreas Louis-Philippe Morency Taylor Berg-Kirkpatrick Kate Saenko Dan Klein and Trevor Darrell. 2018. Speaker-Follower Models for Vision-and-Language Navigation. In Adv. Neural Inform. Process. Syst. 3318--3329."},{"key":"e_1_3_2_1_17_1","volume-title":"Eur. Conf. Comput. Vis. 71--86","author":"Fu Tsu-Jui","year":"2020","unstructured":"Tsu-Jui Fu, Xin Eric Wang, Matthew F Peterson, Scott T Grafton, Miguel P Eckstein, and William Yang Wang. 2020. Counterfactual Vision-and-Language Navigation via Adversarial Path Sampling. In Eur. Conf. Comput. Vis. 71--86."},{"key":"e_1_3_2_1_18_1","volume-title":"Adaptive Zone-Aware Hierarchical Planner for Vision-Language Navigation. In IEEE Conf. Comput. Vis. Pattern Recog. 14911--14920","author":"Gao Chen","year":"2023","unstructured":"Chen Gao, Xingyu Peng, Mi Yan, He Wang, Lirong Yang, Haibing Ren, Hongsheng Li, and Si Liu. 2023. Adaptive Zone-Aware Hierarchical Planner for Vision-Language Navigation. In IEEE Conf. Comput. Vis. Pattern Recog. 14911--14920."},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.563"},{"key":"e_1_3_2_1_20_1","volume-title":"Airbert: In-Domain Pretraining for Vision-and-Language Navigation. In Int. Conf. Comput. Vis. 1634--1643","author":"Guhur Pierre-Louis","year":"2021","unstructured":"Pierre-Louis Guhur, Makarand Tapaswi, Shizhe Chen, Ivan Laptev, and Cordelia Schmid. 2021. Airbert: In-Domain Pretraining for Vision-and-Language Navigation. In Int. Conf. Comput. Vis. 1634--1643."},{"key":"e_1_3_2_1_21_1","volume-title":"Tripping through time: Efficient localization of activities in videos. arXiv preprint arXiv:1904.09936","author":"Hahn Meera","year":"2019","unstructured":"Meera Hahn, Asim Kadav, James M Rehg, and Hans Peter Graf. 2019. Tripping through time: Efficient localization of activities in videos. arXiv preprint arXiv:1904.09936 (2019)."},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01315"},{"key":"e_1_3_2_1_23_1","volume-title":"Yuankai Qi, Qi Wu, and Stephen Gould.","author":"Hong Yicong","year":"2020","unstructured":"Yicong Hong, Cristian Rodriguez Opazo, Yuankai Qi, Qi Wu, and Stephen Gould. 2020. Language and Visual Entity Relationship Graph for Agent Navigation. In Adv. Neural Inform. Process. Syst."},{"key":"e_1_3_2_1_24_1","volume-title":"IEEE Conf. Comput. Vis. Pattern Recog. 1643--1653","author":"Hong Yicong","year":"2021","unstructured":"Yicong Hong, Qi Wu, Yuankai Qi, Cristian Rodriguez Opazo, and Stephen Gould. 2021. rvlnbert: A Recurrent Vision-and-Language BERT for Navigation. In IEEE Conf. Comput. Vis. Pattern Recog. 1643--1653."},{"key":"e_1_3_2_1_25_1","volume-title":"IEEE Conf. Comput. Vis. Pattern Recog. 6741--6749","author":"Ke Liyiming","unstructured":"Liyiming Ke, Xiujun Li, Yonatan Bisk, Ari Holtzman, Zhe Gan, Jingjing Liu, Jianfeng Gao, Yejin Choi, and Siddhartha S. Srinivasa. 2019. Tactical Rewind: Self-Correction via Backtracking in Vision-And-Language Navigation. In IEEE Conf. Comput. Vis. Pattern Recog. 6741--6749."},{"key":"e_1_3_2_1_26_1","volume-title":"Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments. In Eur. Conf. Comput. Vis., Andrea Vedaldi, Horst Bischof, Thomas Brox, and Jan-Michael Frahm (Eds.)","volume":"12373","author":"Krantz Jacob","year":"2020","unstructured":"Jacob Krantz, Erik Wijmans, Arjun Majumdar, Dhruv Batra, and Stefan Lee. 2020. Beyond the Nav-Graph: Vision-and-Language Navigation in Continuous Environments. In Eur. Conf. Comput. Vis., Andrea Vedaldi, Horst Bischof, Thomas Brox, and Jan-Michael Frahm (Eds.), Vol. 12373. 104--120."},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.83"},{"key":"e_1_3_2_1_28_1","unstructured":"Alexander Ku Peter Anderson Roma Patel Eugene Ie and Jason Baldridge. 2020. Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding. In EMNLP. 4392--4412."},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01040"},{"key":"e_1_3_2_1_30_1","volume-title":"2023 b. PanoGen: Text-Conditioned Panoramic Environment Generation for Vision-and-Language Navigation. arXiv preprint arXiv:2305.19195","author":"Li Jialu","year":"2023","unstructured":"Jialu Li and Mohit Bansal. 2023 b. PanoGen: Text-Conditioned Panoramic Environment Generation for Vision-and-Language Navigation. arXiv preprint arXiv:2305.19195 (2023)."},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01497"},{"key":"e_1_3_2_1_32_1","volume-title":"Jianfeng Gao, Noah A. Smith, and Yejin Choi.","author":"Li Xiujun","year":"2019","unstructured":"Xiujun Li, Chunyuan Li, Qiaolin Xia, Yonatan Bisk, Asli cC elikyilmaz, Jianfeng Gao, Noah A. Smith, and Yejin Choi. 2019. Robust Navigation with Language Pretraining and Stochastic Sampling. In EMNLP. 1494--1499."},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"crossref","unstructured":"Xiwen Liang Fengda Zhu Lingling Li Hang Xu and Xiaodan Liang. 2022a. Visual-Language Navigation Pretraining via Prompt-based Environmental Self-exploration. In ACL. 4837--4851.","DOI":"10.18653\/v1\/2022.acl-long.332"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"crossref","unstructured":"Xiwen Liang Fengda Zhu Yi Zhu Bingqian Lin Bing Wang and Xiaodan Liang. 2022b. Contrastive instruction-trajectory learning for vision-language navigation. In AAAI. 1592--1600.","DOI":"10.1609\/aaai.v36i2.20050"},{"key":"e_1_3_2_1_35_1","volume-title":"ADAPT: Vision-Language Navigation with Modality-Aligned Action Prompts. In IEEE Conf. Comput. Vis. Pattern Recog. 15396--15406","author":"Lin Bingqian","year":"2022","unstructured":"Bingqian Lin, Yi Zhu, Zicong Chen, Xiwen Liang, Jianzhuang Liu, and Xiaodan Liang. 2022b. ADAPT: Vision-Language Navigation with Modality-Aligned Action Prompts. In IEEE Conf. Comput. Vis. Pattern Recog. 15396--15406."},{"key":"e_1_3_2_1_36_1","volume-title":"Multimodal Transformer with Variable-Length Memory for Vision-and-Language Navigation. In Eur. Conf. Comput. Vis. 380--397","author":"Lin Chuang","year":"2022","unstructured":"Chuang Lin, Yi Jiang, Jianfei Cai, Lizhen Qu, Gholamreza Haffari, and Zehuan Yuan. 2022a. Multimodal Transformer with Variable-Length Memory for Vision-and-Language Navigation. In Eur. Conf. Comput. Vis. 380--397."},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.324"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00167"},{"key":"e_1_3_2_1_39_1","volume-title":"Roberta: A robustly optimized bert pretraining approach. arXiv preprint arXiv:1907.11692","author":"Liu Yinhan","year":"2019","unstructured":"Yinhan Liu, Myle Ott, Naman Goyal, Jingfei Du, Mandar Joshi, Danqi Chen, Omer Levy, Mike Lewis, Luke Zettlemoyer, and Veselin Stoyanov. 2019. Roberta: A robustly optimized bert pretraining approach. arXiv preprint arXiv:1907.11692 (2019)."},{"key":"e_1_3_2_1_40_1","volume-title":"Decoupled Weight Decay Regularization. In Int. Conf. Learn. Represent.","author":"Loshchilov Ilya","year":"2019","unstructured":"Ilya Loshchilov and Frank Hutter. 2019. Decoupled Weight Decay Regularization. In Int. Conf. Learn. Represent."},{"key":"e_1_3_2_1_41_1","volume-title":"Int. Conf. Learn. Represent.","author":"Ma Chih-Yao","year":"2019","unstructured":"Chih-Yao Ma, Jiasen Lu, Zuxuan Wu, Ghassan AlRegib, Zsolt Kira, Richard Socher, and Caiming Xiong. 2019a. Self-Monitoring Navigation Agent via Auxiliary Progress Estimation. In Int. Conf. Learn. Represent."},{"key":"e_1_3_2_1_42_1","volume-title":"The Regretful Agent: Heuristic-Aided Navigation Through Progress Estimation. In IEEE Conf. Comput. Vis. Pattern Recog. 6732--6740","author":"Ma Chih-Yao","year":"2019","unstructured":"Chih-Yao Ma, Zuxuan Wu, Ghassan AlRegib, Caiming Xiong, and Zsolt Kira. 2019b. The Regretful Agent: Heuristic-Aided Navigation Through Progress Estimation. In IEEE Conf. Comput. Vis. Pattern Recog. 6732--6740."},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1109\/3DV.2016.79"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01082"},{"key":"e_1_3_2_1_45_1","volume-title":"Int. Conf. Comput. Vis. 1655--1664","author":"Qi Yuankai","unstructured":"Yuankai Qi, Zizheng Pan, Yicong Hong, Ming-Hsuan Yang, Anton van den Hengel, and Qi Wu. 2021. The Road to Know-Where: An Object-and-Room Informed Sequential BERT for Indoor Vision-Language Navigation. In Int. Conf. Comput. Vis. 1655--1664."},{"key":"e_1_3_2_1_46_1","volume-title":"Object-and-Action Aware Model for Visual Language Navigation. In Eur. Conf. Comput. Vis. 303--317","author":"Qi Yuankai","unstructured":"Yuankai Qi, Zizheng Pan, Shengping Zhang, Anton van den Hengel, and Qi Wu. 2020a. Object-and-Action Aware Model for Visual Language Navigation. In Eur. Conf. Comput. Vis. 303--317."},{"key":"e_1_3_2_1_47_1","volume-title":"REVERIE: Remote Embodied Visual Referring Expression in Real Indoor Environments. In IEEE Conf. Comput. Vis. Pattern Recog. 9979--9988","author":"Qi Yuankai","unstructured":"Yuankai Qi, Qi Wu, Peter Anderson, Xin Wang, William Yang Wang, Chunhua Shen, and Anton van den Hengel. 2020b. REVERIE: Remote Embodied Visual Referring Expression in Real Indoor Environments. In IEEE Conf. Comput. Vis. Pattern Recog. 9979--9988."},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.3042066"},{"key":"e_1_3_2_1_49_1","volume-title":"IEEE Conf. Comput. Vis. Pattern Recog. 15418--15427","author":"Qiao Yanyuan","year":"2022","unstructured":"Yanyuan Qiao, Yuankai Qi, Yicong Hong, Zheng Yu, Peng Wang, and Qi Wu. 2022. HOP: history-and-order aware pre-training for vision-and-language navigation. In IEEE Conf. Comput. Vis. Pattern Recog. 15418--15427."},{"key":"e_1_3_2_1_50_1","volume-title":"HOP: History-enhanced and Order-aware Pre-training for Vision-and-Language Navigation","author":"Qiao Yanyuan","year":"2023","unstructured":"Yanyuan Qiao, Yuankai Qi, Yicong Hong, Zheng Yu, Peng Wang, and Qi Wu. 2023. HOP: History-enhanced and Order-aware Pre-training for Vision-and-Language Navigation. IEEE Trans. Pattern Anal. Mach. Intell. (2023)."},{"key":"e_1_3_2_1_51_1","volume-title":"Hongdong Li, and Stephen Gould.","author":"Rodriguez Cristian","year":"2020","unstructured":"Cristian Rodriguez, Edison Marrese-Taylor, Fatemeh Sadat Saleh, Hongdong Li, and Stephen Gould. 2020. Proposal-free temporal moment localization of a natural-language query in video using guided attention. In WACV. 2464--2473."},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00156"},{"key":"e_1_3_2_1_54_1","doi-asserted-by":"crossref","unstructured":"Hao Tan Licheng Yu and Mohit Bansal. 2019. Learning to Navigate Unseen Environments: Back Translation with Environmental Dropout. In NAACL-HLT. 2610--2621.","DOI":"10.18653\/v1\/N19-1268"},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3085907"},{"key":"e_1_3_2_1_56_1","unstructured":"Jesse Thomason Michael Murray Maya Cakmak and Luke Zettlemoyer. 2019. Vision-and-Dialog Navigation. In CoRL. 394--406."},{"key":"e_1_3_2_1_57_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In Adv. Neural Inform. Process. Syst. 5998--6008."},{"key":"e_1_3_2_1_58_1","first-page":"36858","article-title":"Towards versatile embodied navigation","volume":"35","author":"Wang Hanqing","year":"2022","unstructured":"Hanqing Wang, Wei Liang, Luc V Gool, and Wenguan Wang. 2022a. Towards versatile embodied navigation. Adv. Neural Inform. Process. Syst., Vol. 35 (2022), 36858--36874.","journal-title":"Adv. Neural Inform. Process. Syst."},{"key":"e_1_3_2_1_59_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01503"},{"key":"e_1_3_2_1_60_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00835"},{"key":"e_1_3_2_1_61_1","volume-title":"Active Visual Information Gathering for Vision-Language Navigation. In Eur. Conf. Comput. Vis.","author":"Wang Hanqing","year":"2020","unstructured":"Hanqing Wang, Wenguan Wang, Tianmin Shu, Wei Liang, and Jianbing Shen. 2020. Active Visual Information Gathering for Vision-Language Navigation. In Eur. Conf. Comput. Vis."},{"key":"e_1_3_2_1_62_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00042"},{"key":"e_1_3_2_1_63_1","volume-title":"Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation. In IEEE Conf. Comput. Vis. Pattern Recog. 6629--6638","author":"Wang Xin","year":"2019","unstructured":"Xin Wang, Qiuyuan Huang, Asli cC elikyilmaz, Jianfeng Gao, Dinghan Shen, Yuan-Fang Wang, William Yang Wang, and Lei Zhang. 2019b. Reinforced Cross-Modal Matching and Self-Supervised Imitation Learning for Vision-Language Navigation. In IEEE Conf. Comput. Vis. Pattern Recog. 6629--6638."},{"key":"e_1_3_2_1_64_1","volume-title":"LANA: A Language-Capable Navigator for Instruction Following and Generation. In IEEE Conf. Comput. Vis. Pattern Recog. 19048--19058","author":"Wang Xiaohan","year":"2023","unstructured":"Xiaohan Wang, Wenguan Wang, Jiayi Shao, and Yi Yang. 2023 b. LANA: A Language-Capable Navigator for Instruction Following and Generation. In IEEE Conf. Comput. Vis. Pattern Recog. 19048--19058."},{"key":"e_1_3_2_1_65_1","volume-title":"2023 a. Scaling Data Generation in Vision-and-Language Navigation. arXiv preprint arXiv:2307.15644","author":"Wang Zun","year":"2023","unstructured":"Zun Wang, Jialu Li, Yicong Hong, Yi Wang, Qi Wu, Mohit Bansal, Stephen Gould, Hao Tan, and Yu Qiao. 2023 a. Scaling Data Generation in Vision-and-Language Navigation. arXiv preprint arXiv:2307.15644 (2023)."},{"key":"e_1_3_2_1_66_1","doi-asserted-by":"crossref","unstructured":"Huijuan Xu Kun He Bryan A Plummer Leonid Sigal Stan Sclaroff and Kate Saenko. 2019. Multilevel language and vision integration for text-to-clip retrieval. In AAAI. 9062--9069.","DOI":"10.1609\/aaai.v33i01.33019062"},{"key":"e_1_3_2_1_67_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.162"},{"key":"e_1_3_2_1_68_1","volume-title":"TubeDETR: Spatio-Temporal Video Grounding With Transformers. In IEEE Conf. Comput. Vis. Pattern Recog. 16442--16453","author":"Yang Antoine","year":"2022","unstructured":"Antoine Yang, Antoine Miech, Josef Sivic, Ivan Laptev, and Cordelia Schmid. 2022. TubeDETR: Spatio-Temporal Video Grounding With Transformers. In IEEE Conf. Comput. Vis. Pattern Recog. 16442--16453."},{"key":"e_1_3_2_1_69_1","volume-title":"MAttNet: Modular Attention Network for Referring Expression Comprehension. In IEEE Conf. Comput. Vis. Pattern Recog. 1307--1315","author":"Yu Licheng","unstructured":"Licheng Yu, Zhe Lin, Xiaohui Shen, Jimei Yang, Xin Lu, Mohit Bansal, and Tamara L. Berg. 2018. MAttNet: Modular Attention Network for Referring Expression Comprehension. In IEEE Conf. Comput. Vis. Pattern Recog. 1307--1315."},{"key":"e_1_3_2_1_70_1","volume-title":"Adv. Neural Inform. Process. Syst.","volume":"32","author":"Yuan Yitian","year":"2019","unstructured":"Yitian Yuan, Lin Ma, Jingwen Wang, Wei Liu, and Wenwu Zhu. 2019a. Semantic conditioned dynamic modulation for temporal sentence grounding in videos. Adv. Neural Inform. Process. Syst., Vol. 32 (2019)."},{"key":"e_1_3_2_1_71_1","doi-asserted-by":"crossref","unstructured":"Yitian Yuan Tao Mei and Wenwu Zhu. 2019b. To find where you talk: Temporal sentence localization in video with attention based location regression. In AAAI. 9159--9166.","DOI":"10.1609\/aaai.v33i01.33019159"},{"key":"e_1_3_2_1_72_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00134"},{"key":"e_1_3_2_1_73_1","volume-title":"Where Does It Exist: Spatio-Temporal Video Grounding for Multi-Form Sentences. In IEEE Conf. Comput. Vis. Pattern Recog.","author":"Zhang Zhu","year":"2020","unstructured":"Zhu Zhang, Zhou Zhao, Yang Zhao, Qi Wang, Huasheng Liu, and Lianli Gao. 2020. Where Does It Exist: Spatio-Temporal Video Grounding for Multi-Form Sentences. In IEEE Conf. Comput. Vis. Pattern Recog."},{"key":"e_1_3_2_1_74_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3548281"},{"key":"e_1_3_2_1_75_1","volume-title":"NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models. arXiv preprint arXiv:2305.16986","author":"Zhou Gengze","year":"2023","unstructured":"Gengze Zhou, Yicong Hong, and Qi Wu. 2023. NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models. arXiv preprint arXiv:2305.16986 (2023)."},{"key":"e_1_3_2_1_76_1","doi-asserted-by":"crossref","unstructured":"Luowei Zhou Chenliang Xu and Jason Corso. 2018. Towards automatic learning of procedures from web instructional videos. In AAAI.","DOI":"10.1609\/aaai.v32i1.12342"},{"key":"e_1_3_2_1_77_1","volume-title":"SOON: Scenario Oriented Object Navigation With Graph-Based Exploration. In IEEE Conf. Comput. Vis. Pattern Recog. 12689--12699","author":"Zhu Fengda","year":"2021","unstructured":"Fengda Zhu, Xiwen Liang, Yi Zhu, Qizhi Yu, Xiaojun Chang, and Xiaodan Liang. 2021. SOON: Scenario Oriented Object Navigation With Graph-Based Exploration. In IEEE Conf. Comput. Vis. Pattern Recog. 12689--12699."}],"event":{"name":"MM '23: The 31st ACM International Conference on Multimedia","location":"Ottawa ON Canada","acronym":"MM '23","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 31st ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3611736","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3581783.3611736","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:10:31Z","timestamp":1755821431000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3611736"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,26]]},"references-count":77,"alternative-id":["10.1145\/3581783.3611736","10.1145\/3581783"],"URL":"https:\/\/doi.org\/10.1145\/3581783.3611736","relation":{},"subject":[],"published":{"date-parts":[[2023,10,26]]},"assertion":[{"value":"2023-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}