{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T16:24:33Z","timestamp":1784305473917,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":54,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,10,28]],"date-time":"2024-10-28T00:00:00Z","timestamp":1730073600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/https:\/\/doi.org\/10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["No. 2022ZD0162000"],"award-info":[{"award-number":["No. 2022ZD0162000"]}],"id":[{"id":"10.13039\/https:\/\/doi.org\/10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,10,28]]},"DOI":"10.1145\/3664647.3681584","type":"proceedings-article","created":{"date-parts":[[2024,10,26]],"date-time":"2024-10-26T06:59:49Z","timestamp":1729925989000},"page":"8845-8854","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":17,"title":["LLaVA-Ultra: Large Chinese Language and Vision Assistant for Ultrasound"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-0682-1138","authenticated-orcid":false,"given":"Xuechen","family":"Guo","sequence":"first","affiliation":[{"name":"ZJU-UIUC Institute, Zhejiang University, Haining, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2611-0008","authenticated-orcid":false,"given":"Wenhao","family":"Chai","sequence":"additional","affiliation":[{"name":"University of Washington, Seattle, WA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3574-7932","authenticated-orcid":false,"given":"Shi-Yan","family":"Li","sequence":"additional","affiliation":[{"name":"Zhejiang University School of Medicine Sir Run Run Shaw Hospital, Hangzhou, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8403-1538","authenticated-orcid":false,"given":"Gaoang","family":"Wang","sequence":"additional","affiliation":[{"name":"ZJU-UIUC Institute, Zhejiang University &amp; Shanghai Artificial Intelligence Laboratory, Haining, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2024,10,28]]},"reference":[{"key":"e_1_3_2_2_1_1","volume-title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic. arxiv: 2306.15195 [cs.CV]","author":"Chen Keqin","year":"2023","unstructured":"Keqin Chen, Zhao Zhang, Weili Zeng, Richong Zhang, Feng Zhu, and Rui Zhao. 2023. Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic. arxiv: 2306.15195 [cs.CV]"},{"key":"e_1_3_2_2_2_1","unstructured":"Shaoxiang Chen Zequn Jie and Lin Ma. 2024. LLaVA-MoLE: Sparse Mixture of LoRA Experts for Mitigating Data Conflicts in Instruction Finetuning MLLMs. arxiv: 2401.16160 [cs.CV]"},{"key":"e_1_3_2_2_3_1","volume-title":"Xing","author":"Chiang Wei-Lin","year":"2023","unstructured":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E. Gonzalez, Ion Stoica, and Eric P. Xing. 2023. Vicuna: An Open-Source Chatbot Impressing GPT-4 with 90%* ChatGPT Quality. https:\/\/lmsys.org\/blog\/2023-03--30-vicuna\/"},{"key":"e_1_3_2_2_4_1","unstructured":"Xiangxiang Chu Limeng Qiao Xinyang Lin Shuang Xu Yang Yang Yiming Hu Fei Wei Xinyu Zhang Bo Zhang Xiaolin Wei and Chunhua Shen. 2023. MobileVLM : A Fast Strong and Open Vision Language Assistant for Mobile Devices. arxiv: 2312.16886 [cs.CV]"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","DOI":"10.1093\/jamia"},{"key":"e_1_3_2_2_6_1","volume-title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. arxiv","author":"Dosovitskiy Alexey","year":"2010","unstructured":"Alexey Dosovitskiy, Lucas Beyer, Alexander Kolesnikov, Dirk Weissenborn, Xiaohua Zhai, Thomas Unterthiner, Mostafa Dehghani, Matthias Minderer, Georg Heigold, Sylvain Gelly, Jakob Uszkoreit, and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. arxiv: 2010.11929 [cs.CV]"},{"key":"e_1_3_2_2_7_1","unstructured":"Sedigheh Eslami Gerard de Melo and Christoph Meinel. 2021. Does CLIP Benefit Visual Question Answering in the Medical Domain as Much as it Does in the General Domain?arxiv: 2112.13906 [cs.CV]"},{"key":"e_1_3_2_2_8_1","volume-title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models. arxiv: 2306.13394 [cs.CV]","author":"Fu Chaoyou","year":"2024","unstructured":"Chaoyou Fu, Peixian Chen, Yunhang Shen, Yulei Qin, Mengdan Zhang, Xu Lin, Jinrui Yang, Xiawu Zheng, Ke Li, Xing Sun, Yunsheng Wu, and Rongrong Ji. 2024. MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models. arxiv: 2306.13394 [cs.CV]"},{"key":"e_1_3_2_2_9_1","unstructured":"Chaoyou Fu Renrui Zhang Zihan Wang Yubo Huang Zhengye Zhang Longtian Qiu Gaoxiang Ye Yunhang Shen Mengdan Zhang Peixian Chen Sirui Zhao Shaohui Lin Deqiang Jiang Di Yin Peng Gao Ke Li Hongsheng Li and Xing Sun. 2023. A Challenger to GPT-4V? Early Explorations of Gemini in Visual Expertise. arxiv: 2312.12436 [cs.CV]"},{"key":"e_1_3_2_2_10_1","unstructured":"Edward J. Hu Yelong Shen Phillip Wallis Zeyuan Allen-Zhu Yuanzhi Li Shean Wang Lu Wang and Weizhu Chen. 2021. LoRA: Low-Rank Adaptation of Large Language Models. arxiv: 2106.09685 [cs.CL]"},{"key":"e_1_3_2_2_11_1","volume-title":"Barun Patra, Qiang Liu, Kriti Aggarwal, Zewen Chi, Johan Bjorck, Vishrav Chaudhary, Subhojit Som, Xia Song, and Furu Wei.","author":"Huang Shaohan","year":"2023","unstructured":"Shaohan Huang, Li Dong, Wenhui Wang, Yaru Hao, Saksham Singhal, Shuming Ma, Tengchao Lv, Lei Cui, Owais Khan Mohammed, Barun Patra, Qiang Liu, Kriti Aggarwal, Zewen Chi, Johan Bjorck, Vishrav Chaudhary, Subhojit Som, Xia Song, and Furu Wei. 2023. Language Is Not All You Need: Aligning Perception with Language Models. arxiv: 2302.14045 [cs.CL]"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.3978\/j.issn.2223--4292.2014.11.20"},{"key":"e_1_3_2_2_13_1","unstructured":"Dongsheng Jiang Yuchen Liu Songlin Liu Jin'e Zhao Hao Zhang Zhen Gao Xiaopeng Zhang Jin Li and Hongkai Xiong. 2024. From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models. arxiv: 2310.08825 [cs.CV]"},{"key":"e_1_3_2_2_14_1","volume-title":"Yifan Peng, Zhiyong Lu, Roger G. Mark, Seth J. Berkowitz, and Steven Horng.","author":"Johnson Alistair E. W.","year":"2019","unstructured":"Alistair E. W. Johnson, Tom J. Pollard, Nathaniel R. Greenbaum, Matthew P. Lungren, Chih ying Deng, Yifan Peng, Zhiyong Lu, Roger G. Mark, Seth J. Berkowitz, and Steven Horng. 2019. MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs. arxiv: 1901.07042 [cs.CV]"},{"key":"e_1_3_2_2_15_1","volume-title":"Kingma and Jimmy Ba","author":"Diederik","year":"2017","unstructured":"Diederik P. Kingma and Jimmy Ba. 2017. Adam: A Method for Stochastic Optimization. arxiv: 1412.6980 [cs.LG]"},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"crossref","unstructured":"Alexander Kirillov Eric Mintun Nikhila Ravi Hanzi Mao Chloe Rolland Laura Gustafson Tete Xiao Spencer Whitehead Alexander C. Berg Wan-Yen Lo Piotr Doll\u00e1r and Ross Girshick. 2023. Segment Anything. arxiv: 2304.02643 [cs.CV]","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"e_1_3_2_2_17_1","unstructured":"Chunyuan Li Cliff Wong Sheng Zhang Naoto Usuyama Haotian Liu Jianwei Yang Tristan Naumann Hoifung Poon and Jianfeng Gao. 2023. LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day. arxiv: 2306.00890 [cs.CV]"},{"key":"e_1_3_2_2_18_1","unstructured":"Junnan Li Dongxu Li Silvio Savarese and Steven Hoi. 2023. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arxiv: 2301.12597 [cs.CV]"},{"key":"e_1_3_2_2_19_1","volume-title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models. arxiv: 2311.06607 [cs.CV]","author":"Li Zhang","year":"2024","unstructured":"Zhang Li, Biao Yang, Qiang Liu, Zhiyin Ma, Shuo Zhang, Jingxu Yang, Yabo Sun, Yuliang Liu, and Xiang Bai. 2024. Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models. arxiv: 2311.06607 [cs.CV]"},{"key":"e_1_3_2_2_20_1","volume-title":"SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering. arxiv: 2102.09542 [cs.CV]","author":"Liu Bo","year":"2021","unstructured":"Bo Liu, Li-Ming Zhan, Li Xu, Lin Ma, Yan Yang, and Xiao-Ming Wu. 2021. SLAKE: A Semantically-Labeled Knowledge-Enhanced Dataset for Medical Visual Question Answering. arxiv: 2102.09542 [cs.CV]"},{"key":"e_1_3_2_2_21_1","unstructured":"Haotian Liu Chunyuan Li Qingyang Wu and Yong Jae Lee. 2023. Visual Instruction Tuning. arxiv: 2304.08485 [cs.CV]"},{"key":"e_1_3_2_2_22_1","unstructured":"Jiasen Lu Christopher Clark Sangho Lee Zichen Zhang Savya Khosla Ryan Marten Derek Hoiem and Aniruddha Kembhavi. 2023. Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision Language Audio and Action. arxiv: 2312.17172 [cs.CV]"},{"key":"e_1_3_2_2_23_1","unstructured":"OpenAI. 2022. ChatGPT. https:\/\/openai.com\/blog\/chatgpt\/."},{"key":"e_1_3_2_2_25_1","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"e_1_3_2_2_26_1","volume-title":"Friedrich","author":"Pelka Obioma","year":"2018","unstructured":"Obioma Pelka, Sven Koitka, Johannes R\u00fcckert, Felix Nensa, and Christoph M. Friedrich. 2018. Radiology Objects in COntext (ROCO): A Multimodal Image Dataset. In Intravascular Imaging and Computer Assisted Stenting and Large-Scale Annotation of Biomedical Data and Expert Label Synthesis, Danail Stoyanov, Zeike Taylor, Simone Balocco, Raphael Sznitman, Anne Martel, Lena Maier-Hein, Luc Duong, Guillaume Zahnd, Stefanie Demirci, Shadi Albarqouni, Su-Lin Lee, Stefano Moriconi, Veronika Cheplygina, Diana Mateus, Emanuele Trucco, Eric Granger, and Pierre Jannin (Eds.). Springer International Publishing, Cham, 180--189."},{"key":"e_1_3_2_2_27_1","unstructured":"Baolin Peng Chunyuan Li Pengcheng He Michel Galley and Jianfeng Gao. 2023. Instruction Tuning with GPT-4. arxiv: 2304.03277 [cs.CL]"},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/jbhi.2023.3316750"},{"key":"e_1_3_2_2_29_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. arxiv: 2103.00020 [cs.CV]"},{"key":"e_1_3_2_2_30_1","unstructured":"Yunhang Shen Chaoyou Fu Peixian Chen Mengdan Zhang Ke Li Xing Sun Yunsheng Wu Shaohui Lin and Rongrong Ji. 2023. Aligning and Prompting Everything All at Once for Universal Visual Perception. arxiv: 2312.02153 [cs.CV]"},{"key":"e_1_3_2_2_31_1","volume-title":"Moviechat: From dense token to sparse memory for long video understanding. arXiv preprint arXiv:2307.16449","author":"Song Enxin","year":"2023","unstructured":"Enxin Song, Wenhao Chai, Guanhong Wang, Yucheng Zhang, Haoyang Zhou, Feiyang Wu, Xun Guo, Tian Ye, Yan Lu, Jenq-Neng Hwang, et al. 2023. Moviechat: From dense token to sparse memory for long video understanding. arXiv preprint arXiv:2307.16449 (2023)."},{"key":"e_1_3_2_2_32_1","volume-title":"Sachin Mehta, Ben Bogin, Madeleine van Zuylen, Sravanthi Parasa, Sameer Singh, Matt Gardner, and Hannaneh Hajishirzi.","author":"Subramanian Sanjay","year":"2020","unstructured":"Sanjay Subramanian, Lucy Lu Wang, Sachin Mehta, Ben Bogin, Madeleine van Zuylen, Sravanthi Parasa, Sameer Singh, Matt Gardner, and Hannaneh Hajishirzi. 2020. MedICaT: A Dataset of Medical Images, Captions, and Textual References. arxiv: 2010.06000 [cs.CV]"},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"crossref","unstructured":"Zeyi Sun Ye Fang Tong Wu Pan Zhang Yuhang Zang Shu Kong Yuanjun Xiong Dahua Lin and Jiaqi Wang. 2023. Alpha-CLIP: A CLIP Model Focusing on Wherever You Want. arxiv: 2312.03818 [cs.CV]","DOI":"10.1109\/CVPR52733.2024.01237"},{"key":"e_1_3_2_2_34_1","unstructured":"Hugo Touvron Thibaut Lavril Gautier Izacard Xavier Martinet Marie-Anne Lachaux Timoth\u00e9e Lacroix Baptiste Rozi\u00e8re Naman Goyal Eric Hambro Faisal Azhar Aurelien Rodriguez Armand Joulin Edouard Grave and Guillaume Lample. 2023. LLaMA: Open and Efficient Foundation Language Models. arxiv: 2302.13971 [cs.CL]"},{"key":"e_1_3_2_2_35_1","volume-title":"Joelle Barral, Dale Webster, Greg S. Corrado, Yossi Matias, Karan Singhal, Pete Florence, Alan Karthikesalingam, and Vivek Natarajan.","author":"Tu Tao","year":"2023","unstructured":"Tao Tu, Shekoofeh Azizi, Danny Driess, Mike Schaekermann, Mohamed Amin, Pi-Chuan Chang, Andrew Carroll, Chuck Lau, Ryutaro Tanno, Ira Ktena, Basil Mustafa, Aakanksha Chowdhery, Yun Liu, Simon Kornblith, David Fleet, Philip Mansfield, Sushant Prakash, Renee Wong, Sunny Virmani, Christopher Semturs, S Sara Mahdavi, Bradley Green, Ewa Dominowska, Blaise Aguera y Arcas, Joelle Barral, Dale Webster, Greg S. Corrado, Yossi Matias, Karan Singhal, Pete Florence, Alan Karthikesalingam, and Vivek Natarajan. 2023. Towards Generalist Biomedical AI. arxiv: 2307.14334 [cs.CL]"},{"key":"e_1_3_2_2_36_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2023. Attention Is All You Need. arxiv: 1706.03762 [cs.CL]"},{"key":"e_1_3_2_2_37_1","unstructured":"Chenyu Wang Weixin Luo Qianyu Chen Haonan Mai Jindi Guo Sixun Dong Xiaohua Xuan Zhengxin Li Lin Ma and Shenghua Gao. 2024. MLLM-Tool: A Multimodal Large Language Model For Tool Agent Learning. arxiv: 2401.10727 [cs.CV]"},{"key":"e_1_3_2_2_38_1","unstructured":"Haochun Wang Chi Liu Nuwa Xi Zewen Qiang Sendong Zhao Bing Qin and Ting Liu. 2023. HuaTuo: Tuning LLaMA Model with Chinese Medical Knowledge. arxiv: 2304.06975 [cs.CL]"},{"key":"e_1_3_2_2_39_1","unstructured":"Haixin Wang Xinlong Yang Jianlong Chang Dian Jin Jinan Sun Shikun Zhang Xiao Luo and Qi Tian. 2023. Parameter-efficient Tuning of Large-scale Multimodal Foundation Model. arxiv: 2305.08381 [cs.CV]"},{"key":"e_1_3_2_2_40_1","unstructured":"Rongsheng Wang Yaofei Duan Junrong Li Patrick Pang and Tao Tan. 2023. XrayGLM: The first Chinese Medical Multimodal Model that Chest Radiographs Summarization. https:\/\/github.com\/WangRongsheng\/XrayGLM."},{"key":"e_1_3_2_2_41_1","volume-title":"Lenna: Language Enhanced Reasoning Detection Assistant. arxiv: 2312.02433 [cs.CV]","author":"Wei Fei","year":"2023","unstructured":"Fei Wei, Xinyu Zhang, Ailing Zhang, Bo Zhang, and Xiangxiang Chu. 2023. Lenna: Language Enhanced Reasoning Detection Assistant. arxiv: 2312.02433 [cs.CV]"},{"key":"e_1_3_2_2_42_1","unstructured":"Penghao Wu and Saining Xie. 2023. V*: Guided Visual Search as a Core Mechanism in Multimodal LLMs. arxiv: 2312.14135 [cs.CV]"},{"key":"e_1_3_2_2_43_1","volume-title":"Doctorglm: Fine-tuning your chinese doctor is not a herculean task. arXiv preprint arXiv:2304.01097","author":"Xiong Honglin","year":"2023","unstructured":"Honglin Xiong, Sheng Wang, Yitao Zhu, Zihao Zhao, Yuxiao Liu, Qian Wang, and Dinggang Shen. 2023. Doctorglm: Fine-tuning your chinese doctor is not a herculean task. arXiv preprint arXiv:2304.01097 (2023)."},{"key":"e_1_3_2_2_44_1","unstructured":"Ming Xu. 2023. MedicalGPT: Training Medical GPT Model. https:\/\/github.com\/shibing624\/MedicalGPT."},{"key":"e_1_3_2_2_45_1","unstructured":"Shukang Yin Chaoyou Fu Sirui Zhao Ke Li Xing Sun Tong Xu and Enhong Chen. 2023. A Survey on Multimodal Large Language Models. arxiv: 2306.13549 [cs.CV]"},{"key":"e_1_3_2_2_46_1","volume-title":"Yong Jae Lee, and Yi Ma","author":"Zhai Yuexiang","year":"2023","unstructured":"Yuexiang Zhai, Shengbang Tong, Xiao Li, Mu Cai, Qing Qu, Yong Jae Lee, and Yi Ma. 2023. Investigating the Catastrophic Forgetting in Multimodal Large Language Models. arxiv: 2309.10313 [cs.CL]"},{"key":"e_1_3_2_2_47_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-emnlp.725"},{"key":"e_1_3_2_2_48_1","unstructured":"Renrui Zhang Jiaming Han Chris Liu Peng Gao Aojun Zhou Xiangfei Hu Shilin Yan Pan Lu Hongsheng Li and Yu Qiao. 2023. LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention. arxiv: 2303.16199 [cs.CV]"},{"key":"e_1_3_2_2_49_1","unstructured":"Sheng Zhang Yanbo Xu Naoto Usuyama Hanwen Xu Jaspreet Bagga Robert Tinn Sam Preston Rajesh Rao Mu Wei Naveen Valluri Cliff Wong Andrea Tupini Yu Wang Matt Mazzola Swadheen Shukla Lars Liden Jianfeng Gao Matthew P. Lungren Tristan Naumann Sheng Wang and Hoifung Poon. 2024. BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs. arxiv: 2303.00915 [cs.CV]"},{"key":"e_1_3_2_2_50_1","unstructured":"Zhenyu Zhang Benlu Wang Weijie Liang Yizhi Li Xuechen Guo Guanhong Wang Shiyan Li and Gaoang Wang. 2023. Sam-Guided Enhanced Fine-Grained Encoding with Mixed Semantic Learning for Medical Image Captioning. arxiv: 2311.01004 [cs.CV]"},{"key":"e_1_3_2_2_51_1","unstructured":"Long Zhao Nitesh B. Gundavarapu Liangzhe Yuan Hao Zhou Shen Yan Jennifer J. Sun Luke Friedman Rui Qian Tobias Weyand Yue Zhao Rachel Hornung Florian Schroff Ming-Hsuan Yang David A. Ross Huisheng Wang Hartwig Adam Mikhail Sirotenko Ting Liu and Boqing Gong. 2024. VideoPrism: A Foundational Visual Encoder for Video Understanding. arxiv: 2402.13217 [cs.CV]"},{"key":"e_1_3_2_2_52_1","unstructured":"Wayne Xin Zhao Kun Zhou Junyi Li Tianyi Tang Xiaolei Wang Yupeng Hou Yingqian Min Beichen Zhang Junjie Zhang Zican Dong Yifan Du Chen Yang Yushuo Chen Zhipeng Chen Jinhao Jiang Ruiyang Ren Yifan Li Xinyu Tang Zikang Liu Peiyu Liu Jian-Yun Nie and Ji-Rong Wen. 2023. A Survey of Large Language Models. arxiv: 2303.18223 [cs.CL]"},{"key":"e_1_3_2_2_53_1","volume-title":"See and think: Embodied agent in virtual environment. arXiv preprint arXiv:2311.15209","author":"Zhao Zhonghan","year":"2023","unstructured":"Zhonghan Zhao, Wenhao Chai, Xuan Wang, Li Boyi, Shengyu Hao, Shidong Cao, Tian Ye, Jenq-Neng Hwang, and Gaoang Wang. 2023. See and think: Embodied agent in virtual environment. arXiv preprint arXiv:2311.15209 (2023)."},{"key":"e_1_3_2_2_54_1","volume-title":"Hierarchical auto-organizing system for open-ended multi-agent navigation. arXiv preprint arXiv:2403.08282","author":"Zhao Zhonghan","year":"2024","unstructured":"Zhonghan Zhao, Kewei Chen, Dongxu Guo, Wenhao Chai, Tian Ye, Yanting Zhang, and Gaoang Wang. 2024. Hierarchical auto-organizing system for open-ended multi-agent navigation. arXiv preprint arXiv:2403.08282 (2024)."},{"key":"e_1_3_2_2_55_1","volume-title":"Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model. arXiv preprint arXiv:2404.04619","author":"Zhao Zhonghan","year":"2024","unstructured":"Zhonghan Zhao, Ke Ma, Wenhao Chai, Xuan Wang, Kewei Chen, Dongxu Guo, Yanting Zhang, Hongwei Wang, and Gaoang Wang. 2024. Do We Really Need a Complex Agent System? Distill Embodied Agent into a Single Model. arXiv preprint arXiv:2404.04619 (2024)."}],"event":{"name":"MM '24: The 32nd ACM International Conference on Multimedia","location":"Melbourne VIC Australia","acronym":"MM '24","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 32nd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3681584","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3664647.3681584","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:17:48Z","timestamp":1750295868000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3681584"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,28]]},"references-count":54,"alternative-id":["10.1145\/3664647.3681584","10.1145\/3664647"],"URL":"https:\/\/doi.org\/10.1145\/3664647.3681584","relation":{},"subject":[],"published":{"date-parts":[[2024,10,28]]},"assertion":[{"value":"2024-10-28","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}