{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T22:11:29Z","timestamp":1783462289229,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":62,"publisher":"ACM","funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62461160308, U23B2010"],"award-info":[{"award-number":["62461160308, U23B2010"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"National Key R&D Program of China","award":["2022ZD0115502"],"award-info":[{"award-number":["2022ZD0115502"]}]},{"name":"?Pioneer? and ?Leading Goose? R&D Program of Zhejiang","award":["2024C01161"],"award-info":[{"award-number":["2024C01161"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3754498","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T06:54:15Z","timestamp":1761375255000},"page":"2576-2585","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":2,"title":["AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-7763-0111","authenticated-orcid":false,"given":"Ruipu","family":"Wu","sequence":"first","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-4757-8629","authenticated-orcid":false,"given":"Yige","family":"Zhang","sequence":"additional","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-7106-8312","authenticated-orcid":false,"given":"Jinyu","family":"Chen","sequence":"additional","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9701-6487","authenticated-orcid":false,"given":"Linjiang","family":"Huang","sequence":"additional","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3109-5770","authenticated-orcid":false,"given":"Shifeng","family":"Zhang","sequence":"additional","affiliation":[{"name":"Sangfor Technologies Inc., Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-7695-5834","authenticated-orcid":false,"given":"Xu","family":"Zhou","sequence":"additional","affiliation":[{"name":"Sangfor Technologies Inc., Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5224-8647","authenticated-orcid":false,"given":"Liang","family":"Wang","sequence":"additional","affiliation":[{"name":"Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9180-2935","authenticated-orcid":false,"given":"Si","family":"Liu","sequence":"additional","affiliation":[{"name":"Beihang University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"crossref","unstructured":"Peter Anderson Qi Wu Damien Teney Jake Bruce Mark Johnson Niko S\u00fcnderhauf Ian Reid Stephen Gould and Anton Van Den Hengel. 2018. Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments. In CVPR.","DOI":"10.1109\/CVPR.2018.00387"},{"key":"e_1_3_2_1_2_1","unstructured":"Christopher Berner Greg Brockman Brooke Chan Vicki Cheung Przemys\u0142aw D\u0119biak Christy Dennison David Farhi Quirin Fischer Shariq Hashme Chris Hesse et al. 2019. Dota 2 with large scale deep reinforcement learning. arXiv (2019)."},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.1145\/3589132.3625625"},{"key":"e_1_3_2_1_4_1","volume-title":"AU-AIR: A Multi-modal Unmanned Aerial Vehicle Dataset for Low Altitude Traffic Surveillance. arXiv preprint","author":"Bozcan Ilker","year":"2020","unstructured":"Ilker Bozcan and Erdal Kayacan. 2020. AU-AIR: A Multi-modal Unmanned Aerial Vehicle Dataset for Low Altitude Traffic Surveillance. arXiv preprint (2020)."},{"key":"e_1_3_2_1_5_1","unstructured":"Anthony Brohan Noah Brown Justice Carbajal Yevgen Chebotar Xi Chen Krzysztof Choromanski Tianli Ding Danny Driess Avinava Dubey Chelsea Finn et al. 2023. Rt-2: Vision-language-action models transfer web knowledge to robotic control. arXiv preprint arXiv:2307.15818 (2023)."},{"key":"e_1_3_2_1_6_1","volume-title":"Matterport3D: Learning from RGB-D Data in Indoor Environments. 3DV","author":"Chang Angel","year":"2017","unstructured":"Angel Chang, Angela Dai, Thomas Funkhouser, Maciej Halber, Matthias Niessner, Manolis Savva, Shuran Song, Andy Zeng, and Yinda Zhang. 2017. Matterport3D: Learning from RGB-D Data in Indoor Environments. 3DV (2017)."},{"key":"e_1_3_2_1_7_1","volume-title":"Touchdown: Natural language navigation and spatial reasoning in visual street environments. In CVPR.","author":"Chen Howard","year":"2019","unstructured":"Howard Chen, Alane Suhr, Dipendra Misra, Noah Snavely, and Yoav Artzi. 2019. Touchdown: Natural language navigation and spatial reasoning in visual street environments. In CVPR."},{"key":"e_1_3_2_1_8_1","volume-title":"Mapgpt: Map-guided prompting for unified vision-and-language navigation. arXiv preprint arXiv:2401.07314","author":"Chen Jiaqi","year":"2024","unstructured":"Jiaqi Chen, Bingqian Lin, Ran Xu, Zhenhua Chai, Xiaodan Liang, and Kwan-Yee K Wong. 2024. Mapgpt: Map-guided prompting for unified vision-and-language navigation. arXiv preprint arXiv:2401.07314 (2024)."},{"key":"e_1_3_2_1_9_1","volume-title":"History aware multimodal transformer for vision-and-language navigation. NeurIPS","author":"Chen Shizhe","year":"2021","unstructured":"Shizhe Chen, Pierre-Louis Guhur, Cordelia Schmid, and Ivan Laptev. 2021. History aware multimodal transformer for vision-and-language navigation. NeurIPS (2021)."},{"key":"e_1_3_2_1_10_1","volume-title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality. See https:\/\/vicuna. lmsys. org (accessed","author":"Chiang Wei-Lin","year":"2023","unstructured":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al., 2023. Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality. See https:\/\/vicuna. lmsys. org (accessed 14 April 2023), Vol. 2, 3 (2023), 6."},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"crossref","unstructured":"Stepan Dergachev and Konstantin Yakovlev. 2021. Distributed Multi-Agent Navigation Based on Reciprocal Collision Avoidance and Locally Confined Multi-Agent Path Finding. In CASE.","DOI":"10.1109\/CASE49439.2021.9551564"},{"key":"e_1_3_2_1_12_1","first-page":"3043","volume-title":"Aerial Vision-and-Dialog Navigation. In Findings of the Association for Computational Linguistics: ACL","author":"Fan Yue","year":"2023","unstructured":"Yue Fan, Winson Chen, Tongzhou Jiang, Chun Zhou, Yi Zhang, and Xin Eric Wang. 2023. Aerial Vision-and-Dialog Navigation. In Findings of the Association for Computational Linguistics: ACL 2023. Association for Computational Linguistics, Toronto, Canada, 3043-3061."},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Yue Fan Shilei Chu Wei Zhang Ran Song and Yibin Li. 2020. Learn by observation: Imitation learning for drone patrolling from videos of a human navigator. In IROS.","DOI":"10.1109\/IROS45743.2020.9340691"},{"key":"e_1_3_2_1_14_1","volume-title":"Speaker-Follower Models for Vision-and-Language Navigation. NeurIPS","author":"Fried Daniel","year":"2018","unstructured":"Daniel Fried, Ronghang Hu, Volkan Cirik, Anna Rohrbach, Jacob Andreas, Louis-Philippe Morency, Taylor Berg-Kirkpatrick, Kate Saenko, Dan Klein, and Trevor Darrell. 2018. Speaker-Follower Models for Vision-and-Language Navigation. NeurIPS (2018)."},{"key":"e_1_3_2_1_15_1","unstructured":"Yunpeng Gao Chenhui Li Zhongrui You Junli Liu Zhen Li Pengan Chen Qizhi Chen Zhonghan Tang Liansheng Wang Penghui Yang et al. 2025. OpenFly: A Versatile Toolchain and Large-scale Benchmark for Aerial Vision-Language Navigation. arXiv preprint arXiv:2502.18041 (2025)."},{"key":"e_1_3_2_1_16_1","volume-title":"Aerial Vision-and-Language Navigation via Semantic-Topo-Metric Representation Guided LLM Reasoning. arXiv preprint arXiv:2410.08500","author":"Gao Yunpeng","year":"2024","unstructured":"Yunpeng Gao, Zhigang Wang, Linglin Jing, Dong Wang, Xuelong Li, and Bin Zhao. 2024. Aerial Vision-and-Language Navigation via Semantic-Topo-Metric Representation Guided LLM Reasoning. arXiv preprint arXiv:2410.08500 (2024)."},{"key":"e_1_3_2_1_17_1","volume-title":"Gianni Di Caro, et al","author":"Giusti Alessandro","year":"2015","unstructured":"Alessandro Giusti, J\u00e9r\u00f4me Guzzi, Dan C Cire\u015fan, Fang-Lin He, Juan P Rodr\u00edguez, Flavio Fontana, Matthias Faessler, Christian Forster, J\u00fcrgen Schmidhuber, Gianni Di Caro, et al., 2015. A machine learning approach to visual perception of forest trails for mobile robots. IEEE RAL (2015)."},{"key":"e_1_3_2_1_18_1","unstructured":"Zonghao Guo Ruyi Xu Yuan Yao Junbo Cui Zanlin Ni Chunjiang Ge Tat-Seng Chua Zhiyuan Liu and Gao Huang. 2025. Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images. In ECCV."},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1109\/TSSC.1968.300136"},{"key":"e_1_3_2_1_20_1","volume-title":"Zijuan Lin, et al.","author":"Hong Sirui","year":"2024","unstructured":"Sirui Hong, Mingchen Zhuge, Jonathan Chen, Xiawu Zheng, Yuheng Cheng, Jinlin Wang, Ceyao Zhang, Zili Wang, Steven Ka Shing Yau, Zijuan Lin, et al., 2024. MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework. In ICLR."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"Yicong Hong Qi Wu Yuankai Qi Cristian Rodriguez-Opazo and Stephen Gould. 2021. A recurrent vision-and-language bert for navigation. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00169"},{"key":"e_1_3_2_1_22_1","volume-title":"Stay on the path: Instruction fidelity in vision-and-language navigation. arXiv preprint","author":"Jain Vihan","year":"2019","unstructured":"Vihan Jain, Gabriel Magalhaes, Alexander Ku, Ashish Vaswani, Eugene Ie, and Jason Baldridge. 2019. Stay on the path: Instruction fidelity in vision-and-language navigation. arXiv preprint (2019)."},{"key":"e_1_3_2_1_23_1","volume-title":"Generalization through simulation: Integrating simulated and real data into deep reinforcement learning for vision-based autonomous flight. arXiv preprint","author":"Kang Katie","year":"2019","unstructured":"Katie Kang, Suneel Belkhale, Gregory Kahn, Pieter Abbeel, and Sergey Levine. 2019. Generalization through simulation: Integrating simulated and real data into deep reinforcement learning for vision-based autonomous flight. arXiv preprint (2019)."},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"crossref","unstructured":"Jacob Krantz Erik Wijmans Arjun Majumdar Dhruv Batra and Stefan Lee. 2020. Beyond the nav-graph: Vision-and-language navigation in continuous environments. In ECCV.","DOI":"10.1007\/978-3-030-58604-1_7"},{"key":"e_1_3_2_1_25_1","unstructured":"Alexander Ku Peter Anderson Roma Patel Eugene Ie and Jason Baldridge. 2020. Room-Across-Room: Multilingual Vision-and-Language Navigation with Dense Spatiotemporal Grounding. In EMNLP."},{"key":"e_1_3_2_1_26_1","volume-title":"CityNav: Language-Goal Aerial Navigation Dataset with Geographic Information. arXiv preprint","author":"Lee Jungdae","year":"2024","unstructured":"Jungdae Lee, Taiki Miyanishi, Shuhei Kurita, Koya Sakamoto, Daichi Azuma, Yutaka Matsuo, and Nakamasa Inoue. 2024. CityNav: Language-Goal Aerial Navigation Dataset with Geographic Information. arXiv preprint (2024)."},{"key":"e_1_3_2_1_27_1","volume-title":"LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding. arXiv preprint arXiv:2501.08282","author":"Li Hongyu","year":"2025","unstructured":"Hongyu Li, Jinyu Chen, Ziyu Wei, Shaofei Huang, Tianrui Hui, Jialin Gao, Xiaoming Wei, and Si Liu. 2025. LLaVA-ST: A Multimodal Large Language Model for Fine-Grained Spatial-Temporal Understanding. arXiv preprint arXiv:2501.08282 (2025)."},{"key":"e_1_3_2_1_28_1","volume-title":"Advances in Neural Information Processing Systems","volume":"36","author":"Li Jialu","year":"2024","unstructured":"Jialu Li and Mohit Bansal. 2024. Panogen: Text-conditioned panoramic environment generation for vision-and-language navigation. Advances in Neural Information Processing Systems, Vol. 36 (2024)."},{"key":"e_1_3_2_1_29_1","unstructured":"Shilong Liu Zhaoyang Zeng Tianhe Ren Feng Li Hao Zhang Jie Yang Chunyuan Li Jianwei Yang Hang Su Jun Zhu et al. 2023a. Grounding dino: Marrying dino with grounded pre-training for open-set object detection. arXiv preprint arXiv:2303.05499 (2023)."},{"key":"e_1_3_2_1_30_1","volume-title":"Aerialvln: Vision-and-language navigation for uavs. In ICCV.","author":"Liu Shubo","year":"2023","unstructured":"Shubo Liu, Hongsheng Zhang, Yuankai Qi, Peng Wang, Yanning Zhang, and Qi Wu. 2023b. Aerialvln: Vision-and-language navigation for uavs. In ICCV."},{"key":"e_1_3_2_1_31_1","volume-title":"NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation. arXiv preprint","author":"Liu Youzhi","year":"2024","unstructured":"Youzhi Liu, Fanglong Yao, Yuanchang Yue, Guangluan Xu, Xian Sun, and Kun Fu. 2024. NavAgent: Multi-scale Urban Street View Fusion For UAV Embodied Vision-and-Language Navigation. arXiv preprint (2024)."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2018.2795643"},{"key":"e_1_3_2_1_33_1","volume-title":"Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101","author":"Loshchilov Ilya","year":"2017","unstructured":"Ilya Loshchilov and Frank Hutter. 2017. Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101 (2017)."},{"key":"e_1_3_2_1_34_1","volume-title":"OpenAI Pieter Abbeel, and Igor Mordatch","author":"Lowe Ryan","year":"2017","unstructured":"Ryan Lowe, Yi I Wu, Aviv Tamar, Jean Harb, OpenAI Pieter Abbeel, and Igor Mordatch. 2017. Multi-agent actor-critic for mixed cooperative-competitive environments. NeurIPS (2017)."},{"key":"e_1_3_2_1_35_1","volume-title":"The Zurich urban micro aerial vehicle dataset. The IJRR","author":"Majdik Andr\u00e1s L","year":"2017","unstructured":"Andr\u00e1s L Majdik, Charles Till, and Davide Scaramuzza. 2017. The Zurich urban micro aerial vehicle dataset. The IJRR (2017)."},{"key":"e_1_3_2_1_36_1","unstructured":"Viktor Makoviychuk Lukasz Wawrzyniak Yunrong Guo Michelle Lu Kier Storey Miles Macklin David Hoeller Nikita Rudin Arthur Allshire Ankur Handa et al. 2021. Isaac gym: High performance gpu-based physics simulation for robot learning. arXiv preprint arXiv:2108.10470 (2021)."},{"key":"e_1_3_2_1_37_1","first-page":"186","article-title":"Fly-by-logic: Control of multi-drone fleets with temporal logic objectives","author":"Pant Yash Vardhan","year":"2018","unstructured":"Yash Vardhan Pant, Houssam Abbas, Rhudii A Quaye, and Rahul Mangharam. 2018. Fly-by-logic: Control of multi-drone fleets with temporal logic objectives. In ICCPS. IEEE, 186-197.","journal-title":"ICCPS. IEEE"},{"key":"e_1_3_2_1_38_1","volume-title":"Noburu Kuno, Andre Kramer, Sam Devlin, Raluca D Gaina, and Daniel Ionita.","author":"Perez-Liebana Diego","year":"2019","unstructured":"Diego Perez-Liebana, Katja Hofmann, Sharada Prasanna Mohanty, Noburu Kuno, Andre Kramer, Sam Devlin, Raluca D Gaina, and Daniel Ionita. 2019. . arXiv preprint arXiv:1901.08129 (2019)."},{"key":"e_1_3_2_1_39_1","volume-title":"Chunhua Shen, and Anton van den Hengel.","author":"Qi Yuankai","year":"2020","unstructured":"Yuankai Qi, Qi Wu, Peter Anderson, Xin Wang, William Yang Wang, Chunhua Shen, and Anton van den Hengel. 2020. Reverie: Remote embodied visual referring expression in real indoor environments. In CVPR."},{"key":"e_1_3_2_1_40_1","volume-title":"European Conference on Computer Vision. Springer, 459-476","author":"Qiao Yanyuan","year":"2024","unstructured":"Yanyuan Qiao, Qianyi Liu, Jiajun Liu, Jing Liu, and Qi Wu. 2024. LLM as Copilot for Coarse-Grained Vision-and-Language Navigation. In European Conference on Computer Vision. Springer, 459-476."},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01357"},{"key":"e_1_3_2_1_42_1","volume-title":"Gregory Farquhar, Nantas Nardelli, Tim GJ Rudner, Chia-Man Hung, Philip HS Torr, Jakob Foerster, and Shimon Whiteson.","author":"Samvelyan Mikayel","year":"2019","unstructured":"Mikayel Samvelyan, Tabish Rashid, Christian Schroeder De Witt, Gregory Farquhar, Nantas Nardelli, Tim GJ Rudner, Chia-Man Hung, Philip HS Torr, Jakob Foerster, and Shimon Whiteson. 2019. The starcraft multi-agent challenge. arXiv (2019)."},{"key":"e_1_3_2_1_43_1","volume-title":"Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347","author":"Schulman John","year":"2017","unstructured":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov. 2017. Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347 (2017)."},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-67361-5_40"},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/TITS.2019.2954952"},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"crossref","unstructured":"Nikolai Smolyanskiy Alexey Kamenev Jeffrey Smith and Stan Birchfield. 2017. Toward low-flying autonomous MAV trail navigation using deep neural networks for environmental awareness. In IROS.","DOI":"10.1109\/IROS.2017.8206285"},{"key":"e_1_3_2_1_47_1","volume-title":"Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971","author":"Touvron Hugo","year":"2023","unstructured":"Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timoth\u00e9e Lacroix, Baptiste Rozi\u00e8re, Naman Goyal, Eric Hambro, Faisal Azhar, et al., 2023. Llama: Open and efficient foundation language models. arXiv preprint arXiv:2302.13971 (2023)."},{"key":"e_1_3_2_1_48_1","volume-title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution. arXiv preprint arXiv:2409.12191","author":"Wang Peng","year":"2024","unstructured":"Peng Wang, Shuai Bai, Sinan Tan, Shijie Wang, Zhihao Fan, Jinze Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Yang Fan, Kai Dang, Mengfei Du, Xuancheng Ren, Rui Men, Dayiheng Liu, Chang Zhou, Jingren Zhou, and Junyang Lin. 2024a. Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution. arXiv preprint arXiv:2409.12191 (2024)."},{"key":"e_1_3_2_1_49_1","volume-title":"Jason Baldridge, and Peter Anderson.","author":"Wang Su","year":"2022","unstructured":"Su Wang, Ceslee Montgomery, Jordi Orbay, Vighnesh Birodkar, Aleksandra Faust, Izzeddin Gur, Natasha Jaques, Austin Waters, Jason Baldridge, and Peter Anderson. 2022. Less is more: Generating grounded navigation instructions from landmarks. In CVPR."},{"key":"e_1_3_2_1_50_1","unstructured":"Xiangyu Wang Donglin Yang Ziqin Wang Hohin Kwan Jinyu Chen Wenjun Wu Hongsheng Li Yue Liao and Si Liu. 2024b. Towards Realistic UAV Vision-Language Navigation: Platform Benchmark and Methodology."},{"key":"e_1_3_2_1_51_1","volume-title":"Navrl: Learning safe flight in dynamic environments","author":"Xu Zhefan","year":"2025","unstructured":"Zhefan Xu, Xinming Han, Haoyu Shen, Hanyu Jin, and Kenji Shimada. 2025. Navrl: Learning safe flight in dynamic environments. IEEE RAL (2025)."},{"key":"e_1_3_2_1_52_1","volume-title":"Evaluating spatial understanding of large language models. arXiv preprint arXiv:2310.14540","author":"Yamada Yutaro","year":"2023","unstructured":"Yutaro Yamada, Yihan Bao, Andrew K Lampinen, Jungo Kasai, and Ilker Yildirim. 2023. Evaluating spatial understanding of large language models. arXiv preprint arXiv:2310.14540 (2023)."},{"key":"e_1_3_2_1_53_1","first-page":"21875","article-title":"Depth anything v2","volume":"37","author":"Yang Lihe","year":"2024","unstructured":"Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiaogang Xu, Jiashi Feng, and Hengshuang Zhao. 2024. Depth anything v2. NeurIPS, Vol. 37 (2024), 21875-21911.","journal-title":"NeurIPS"},{"key":"e_1_3_2_1_54_1","volume-title":"Modeling context in referring expressions","author":"Yu Licheng","unstructured":"Licheng Yu, Patrick Poirson, Shan Yang, Alexander C Berg, and Tamara L Berg. 2016. Modeling context in referring expressions. In ECCV. Springer, 69-85."},{"key":"e_1_3_2_1_55_1","volume-title":"Kefa: A Knowledge Enhanced and Fine-grained Aligned Speaker for Navigation Instruction Generation. arXiv preprint arXiv:2307.13368","author":"Zeng Haitian","year":"2023","unstructured":"Haitian Zeng, Xiaohan Wang, Wenguan Wang, and Yi Yang. 2023. Kefa: A Knowledge Enhanced and Fine-grained Aligned Speaker for Navigation Instruction Generation. arXiv preprint arXiv:2307.13368 (2023)."},{"key":"e_1_3_2_1_56_1","volume-title":"Navid: Video-based vlm plans the next step for vision-and-language navigation. arXiv preprint arXiv:2402.15852","author":"Zhang Jiazhao","year":"2024","unstructured":"Jiazhao Zhang, Kunyu Wang, Rongtao Xu, Gengze Zhou, Yicong Hong, Xiaomeng Fang, Qi Wu, Zhizheng Zhang, and He Wang. 2024. Navid: Video-based vlm plans the next step for vision-and-language navigation. arXiv preprint arXiv:2402.15852 (2024)."},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"crossref","unstructured":"Yue Zhang and Parisa Kordjamshidi. 2023. VLN-Trans Translator for the Vision and Language Navigation Agent. In ACL.","DOI":"10.18653\/v1\/2023.acl-long.737"},{"key":"e_1_3_2_1_58_1","doi-asserted-by":"crossref","unstructured":"Yusheng Zhao Jinyu Chen Chen Gao Wenguan Wang Lirong Yang Haibing Ren Huaxia Xia and Si Liu. 2022. Target-Driven Structured Transformer Planner for Vision-Language Navigation. In ACM MM.","DOI":"10.1145\/3503161.3548281"},{"key":"e_1_3_2_1_59_1","volume-title":"Hierarchical auto-organizing system for open-ended multi-agent navigation. arXiv","author":"Zhao Zhonghan","year":"2024","unstructured":"Zhonghan Zhao, Kewei Chen, Dongxu Guo, Wenhao Chai, Tian Ye, Yanting Zhang, and Gaoang Wang. 2024. Hierarchical auto-organizing system for open-ended multi-agent navigation. arXiv (2024)."},{"key":"e_1_3_2_1_60_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01293"},{"key":"e_1_3_2_1_61_1","volume-title":"MLVU: A Comprehensive Benchmark for Multi-Task Long Video Understanding. arXiv preprint arXiv:2406.04264","author":"Zhou Junjie","year":"2024","unstructured":"Junjie Zhou, Yan Shu, Bo Zhao, Boya Wu, Shitao Xiao, Xi Yang, Yongping Xiong, Bo Zhang, Tiejun Huang, and Zheng Liu. 2024. MLVU: A Comprehensive Benchmark for Multi-Task Long Video Understanding. arXiv preprint arXiv:2406.04264 (2024)."},{"key":"e_1_3_2_1_62_1","volume-title":"Communicative and Cooperative Learning for Multi-agent Indoor Navigation. In Pacific-Asia Conference on Knowledge Discovery and Data Mining. Springer, 273-285","author":"Zhu Fengda","year":"2024","unstructured":"Fengda Zhu, Vincent CS Lee, and Rui Liu. 2024. Communicative and Cooperative Learning for Multi-agent Indoor Navigation. In Pacific-Asia Conference on Knowledge Discovery and Data Mining. Springer, 273-285."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","acronym":"MM '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3754498","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:01:53Z","timestamp":1765339313000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3754498"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":62,"alternative-id":["10.1145\/3746027.3754498","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3754498","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}