{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T15:09:30Z","timestamp":1781622570650,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":48,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T00:00:00Z","timestamp":1781481600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,6,16]]},"DOI":"10.1145\/3805622.3810616","type":"proceedings-article","created":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:42:57Z","timestamp":1781534577000},"page":"2457-2466","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["RoDE: Linear Rectified Mixture of Diverse Experts for Food Large Multi-Modal Models"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0007-0542-3482","authenticated-orcid":false,"given":"Pengkun","family":"Jiao","sequence":"first","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-2764-4279","authenticated-orcid":false,"given":"Xinlan","family":"Wu","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9213-2611","authenticated-orcid":false,"given":"Bin","family":"Zhu","sequence":"additional","affiliation":[{"name":"Singapore Management University, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-8457-8670","authenticated-orcid":false,"given":"Jingjing","family":"Chen","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4182-8261","authenticated-orcid":false,"given":"Chong-Wah","family":"Ngo","sequence":"additional","affiliation":[{"name":"Singapore Management University, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1907-8567","authenticated-orcid":false,"given":"Yu-Gang","family":"Jiang","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,6,15]]},"reference":[{"key":"e_1_3_3_3_2_2","unstructured":"Josh Achiam Steven Adler Sandhini Agarwal Lama Ahmad Ilge Akkaya Florencia\u00a0Leoni Aleman Diogo Almeida Janko Altenschmidt Sam Altman Shyamal Anadkat et\u00a0al. 2023. Gpt-4 technical report. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2303.08774 (2023)."},{"key":"e_1_3_3_3_3_2","doi-asserted-by":"publisher","DOI":"10.1145\/3347448.3357172"},{"key":"e_1_3_3_3_4_2","doi-asserted-by":"publisher","unstructured":"Jinze Bai Shuai Bai Shusheng Yang Shijie Wang Sinan Tan Peng Wang Junyang Lin Chang Zhou and Jingren Zhou. 2023. Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities. CoRR abs\/2308.12966 (2023). arXiv:https:\/\/arXiv.org\/abs\/2308.1296610.48550\/ARXIV.2308.12966","DOI":"10.48550\/ARXIV.2308.12966"},{"key":"e_1_3_3_3_5_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10599-4_29"},{"key":"e_1_3_3_3_6_2","doi-asserted-by":"publisher","DOI":"10.1145\/2964284.2964315"},{"key":"e_1_3_3_3_7_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-51811-4_48"},{"key":"e_1_3_3_3_8_2","doi-asserted-by":"crossref","unstructured":"Jingjing Chen Bin Zhu Chong-Wah Ngo Tat-Seng Chua and Yu-Gang Jiang. 2020. A study of multi-task and region-wise deep learning for food ingredient recognition. IEEE Transactions on Image Processing 30 (2020) 1514\u20131526.","DOI":"10.1109\/TIP.2020.3045639"},{"key":"e_1_3_3_3_9_2","unstructured":"Shaoxiang Chen Zequn Jie and Lin Ma. 2024. Llava-mole: Sparse mixture of lora experts for mitigating data conflicts in instruction finetuning mllms. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2401.16160 (2024)."},{"key":"e_1_3_3_3_10_2","doi-asserted-by":"publisher","DOI":"10.1109\/WACV57701.2024.00800"},{"key":"e_1_3_3_3_11_2","doi-asserted-by":"crossref","unstructured":"Ning Ding Yujia Qin Guang Yang Fuchao Wei Zonghan Yang Yusheng Su Shengding Hu Yulin Chen Chi-Min Chan Weize Chen et\u00a0al. 2023. Parameter-efficient fine-tuning of large-scale pre-trained language models. Nature Machine Intelligence 5 3 (2023) 220\u2013235.","DOI":"10.1038\/s42256-023-00626-4"},{"key":"e_1_3_3_3_12_2","unstructured":"Shihan Dou Enyu Zhou Yan Liu Songyang Gao Jun Zhao Wei Shen Yuhao Zhou Zhiheng Xi Xiao Wang Xiaoran Fan et\u00a0al. 2023. Loramoe: Revolutionizing mixture of experts for maintaining world knowledge in language model alignment. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2312.09979 (2023)."},{"key":"e_1_3_3_3_13_2","doi-asserted-by":"publisher","unstructured":"Jixiang Gao Jingjing Chen Huazhu Fu and Yu-Gang Jiang. 2023. Dynamic Mixup for Multi-Label Long-Tailed Food Ingredient Recognition. IEEE Transactions on Multimedia 25 (2023) 4764\u20134773. 10.1109\/TMM.2022.3181789","DOI":"10.1109\/TMM.2022.3181789"},{"key":"e_1_3_3_3_14_2","unstructured":"Yunhao Gou Zhili Liu Kai Chen Lanqing Hong Hang Xu Aoxue Li Dit-Yan Yeung James\u00a0T Kwok and Yu Zhang. 2023. Mixture of cluster-conditional lora experts for vision-language instruction tuning. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2312.12379 (2023)."},{"key":"e_1_3_3_3_15_2","volume-title":"International Conference on Learning Representations","author":"Hu Edward\u00a0J","year":"2022","unstructured":"Edward\u00a0J Hu, yelong shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen. 2022. LoRA: Low-Rank Adaptation of Large Language Models. In International Conference on Learning Representations. https:\/\/openreview.net\/forum?id=nZeVKeeFYf9"},{"key":"e_1_3_3_3_16_2","unstructured":"Chengsong Huang Qian Liu Bill\u00a0Yuchen Lin Tianyu Pang Chao Du and Min Lin. 2023. Lorahub: Efficient cross-task generalization via dynamic lora composition. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2307.13269 (2023)."},{"key":"e_1_3_3_3_17_2","doi-asserted-by":"crossref","unstructured":"Shuqiang Jiang Weiqing Min Linhu Liu and Zhengdong Luo. 2019. Multi-scale multi-view deep feature aggregation for food recognition. IEEE Transactions on Image Processing 29 (2019) 265\u2013276.","DOI":"10.1109\/TIP.2019.2929447"},{"key":"e_1_3_3_3_18_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.00262"},{"key":"e_1_3_3_3_19_2","volume-title":"Proc. of ECCV Workshop on Transferring and Adapting Source Knowledge in Computer Vision (TASK-CV)","author":"Kawano Y.","year":"2014","unstructured":"Y. Kawano and K. Yanai. 2014. Automatic Expansion of a Food Image Dataset Leveraging Existing Categories with Domain Adaptation. In Proc. of ECCV Workshop on Transferring and Adapting Source Knowledge in Computer Vision (TASK-CV)."},{"key":"e_1_3_3_3_20_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00915"},{"key":"e_1_3_3_3_21_2","unstructured":"Bin Lin Zhenyu Tang Yang Ye Jiaxi Cui Bin Zhu Peng Jin Junwu Zhang Munan Ning and Li Yuan. 2024. Moe-llava: Mixture of experts for large vision-language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2401.15947 (2024)."},{"key":"e_1_3_3_3_22_2","first-page":"74","volume-title":"Text summarization branches out","author":"Lin Chin-Yew","year":"2004","unstructured":"Chin-Yew Lin. 2004. Rouge: A package for automatic evaluation of summaries. In Text summarization branches out. 74\u201381."},{"key":"e_1_3_3_3_23_2","unstructured":"Guoshan Liu Yang Jiao Jingjing Chen Bin Zhu and Yu-Gang Jiang. 2024. From Canteen Food to Daily Meals: Generalizing Food Recognition to More Practical Scenarios. IEEE Transactions on Multimedia (2024)."},{"key":"e_1_3_3_3_24_2","volume-title":"Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023","author":"Liu Haotian","year":"2023","unstructured":"Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong\u00a0Jae Lee. 2023. Visual Instruction Tuning. In Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023, Alice Oh, Tristan Naumann, Amir Globerson, Kate Saenko, Moritz Hardt, and Sergey Levine (Eds.). http:\/\/papers.nips.cc\/paper_files\/paper\/2023\/hash\/6dcf277ea32ce3288914faf369fe6de0-Abstract-Conference.html"},{"key":"e_1_3_3_3_25_2","unstructured":"Qidong Liu Xian Wu Xiangyu Zhao Yuanshao Zhu Derong Xu Feng Tian and Yefeng Zheng. 2023. Moelora: An moe-based parameter efficient fine-tuning method for multi-task medical applications. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2310.18339 (2023)."},{"key":"e_1_3_3_3_26_2","doi-asserted-by":"crossref","unstructured":"Yuxin Liu Weiqing Min Shuqiang Jiang and Yong Rui. 2024. Convolution-Enhanced Bi-Branch Adaptive Transformer with Cross-Task Interaction for Food Category and Ingredient Recognition. IEEE Transactions on Image Processing (2024).","DOI":"10.1109\/TIP.2024.3374211"},{"key":"e_1_3_3_3_27_2","volume-title":"International Conference on Learning Representations","author":"Loshchilov Ilya","year":"2019","unstructured":"Ilya Loshchilov and Frank Hutter. 2019. Decoupled Weight Decay Regularization. In International Conference on Learning Representations. https:\/\/openreview.net\/forum?id=Bkg6RiCqY7"},{"key":"e_1_3_3_3_28_2","unstructured":"Mengjiang Luo Weiqing Min Zhiling Wang Jiajun Song and Shuqiang Jiang. 2023. Ingredient prediction via context learning network with class-adaptive asymmetric loss. IEEE Transactions on Image Processing (2023)."},{"key":"e_1_3_3_3_29_2","unstructured":"Javier Marin Aritro Biswas Ferda Ofli Nicholas Hynes Amaia Salvador Yusuf Aytar Ingmar Weber and Antonio Torralba. 2019. Recipe1M+: A Dataset for Learning Cross-Modal Embeddings for Cooking Recipes and Food Images. IEEE Trans. Pattern Anal. Mach. Intell. (2019)."},{"key":"e_1_3_3_3_30_2","doi-asserted-by":"crossref","unstructured":"Weiqing Min Shuqiang Jiang Linhu Liu Yong Rui and Ramesh Jain. 2019. A survey on food computing. ACM Computing Surveys (CSUR) 52 5 (2019) 1\u201336.","DOI":"10.1145\/3329168"},{"key":"e_1_3_3_3_31_2","unstructured":"Weiqing Min Zhiling Wang Yuxin Liu Mengjiang Luo Liping Kang Xiaoming Wei Xiaolin Wei and Shuqiang Jiang. 2023. Large scale visual food recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence (2023)."},{"key":"e_1_3_3_3_32_2","doi-asserted-by":"publisher","DOI":"10.5555\/3104322.3104425"},{"key":"e_1_3_3_3_33_2","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413765"},{"key":"e_1_3_3_3_34_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.eacl-main.49"},{"key":"e_1_3_3_3_35_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W18-6319"},{"key":"e_1_3_3_3_36_2","volume-title":"30th British Machine Vision Conference 2019, BMVC 2019, Cardiff, UK, September 9-12, 2019","author":"Qiu Jianing","year":"2019","unstructured":"Jianing Qiu, Frank Po\u00a0Wen Lo, Yingnan Sun, Siyao Wang, and Benny Lo. 2019. Mining Discriminative Food Regions for Accurate Food Recognition. In 30th British Machine Vision Conference 2019, BMVC 2019, Cardiff, UK, September 9-12, 2019. BMVA Press, Article 158. https:\/\/bmvc2019.org\/wp-content\/uploads\/papers\/0839-paper.pdf"},{"key":"e_1_3_3_3_37_2","unstructured":"Alec Radford Karthik Narasimhan Tim Salimans Ilya Sutskever et\u00a0al. 2018. Improving language understanding by generative pre-training. (2018)."},{"key":"e_1_3_3_3_38_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01070"},{"key":"e_1_3_3_3_39_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.327"},{"key":"e_1_3_3_3_40_2","volume-title":"European Conference on Computer Vision","author":"Song Fangzhou","year":"2024","unstructured":"Fangzhou Song, Bin Zhu, Yanbin Hao, and Shuo Wang. 2024. Enhancing Recipe Retrieval with Foundation Models: A Data Augmentation Perspective. In European Conference on Computer Vision."},{"key":"e_1_3_3_3_41_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00879"},{"key":"e_1_3_3_3_42_2","unstructured":"Hugo Touvron Louis Martin Kevin Stone Peter Albert Amjad Almahairi Yasmine Babaei Nikolay Bashlykov Soumya Batra Prajjwal Bhargava Shruti Bhosale et\u00a0al. 2023. Llama 2: Open foundation and fine-tuned chat models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2307.09288 (2023)."},{"key":"e_1_3_3_3_43_2","doi-asserted-by":"crossref","unstructured":"Zhiling Wang Weiqing Min Zhuo Li Liping Kang Xiaoming Wei Xiaolin Wei and Shuqiang Jiang. 2022. Ingredient-guided region discovery and relationship modeling for food category-ingredient prediction. IEEE Transactions on Image Processing 31 (2022) 5214\u20135226.","DOI":"10.1109\/TIP.2022.3193763"},{"key":"e_1_3_3_3_44_2","doi-asserted-by":"publisher","unstructured":"Yuehao Yin Huiyan Qi Bin Zhu Jingjing Chen Yu-Gang Jiang and Chong-Wah Ngo. 2025. FoodLMM: A Versatile Food Assistant Using Large Multi-Modal Model. IEEE Trans. Multim. 27 (2025) 6949\u20136961. 10.1109\/TMM.2025.3590924","DOI":"10.1109\/TMM.2025.3590924"},{"key":"e_1_3_3_3_45_2","doi-asserted-by":"crossref","unstructured":"Pengfei Zhou Weiqing Min Jiajun Song Yang Zhang and Shuqiang Jiang. 2024. Synthesizing knowledge-enhanced features for real-world zero-shot food detection. IEEE Transactions on Image Processing (2024).","DOI":"10.1109\/TIP.2024.3360899"},{"key":"e_1_3_3_3_46_2","doi-asserted-by":"crossref","unstructured":"Yanqi Zhou Tao Lei Hanxiao Liu Nan Du Yanping Huang Vincent Zhao Andrew\u00a0M Dai Quoc\u00a0V Le James Laudon et\u00a0al. 2022. Mixture-of-experts with expert choice routing. Advances in Neural Information Processing Systems 35 (2022) 7103\u20137114.","DOI":"10.52202\/068431-0515"},{"key":"e_1_3_3_3_47_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00556"},{"key":"e_1_3_3_3_48_2","doi-asserted-by":"crossref","unstructured":"Bin Zhu Chong-Wah Ngo and Wing-Kwong Chan. 2021. Learning from web recipe-image pairs for food recognition: Problem baselines and performance. IEEE Transactions on Multimedia 24 (2021) 1175\u20131185.","DOI":"10.1109\/TMM.2021.3123474"},{"key":"e_1_3_3_3_49_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01174"}],"event":{"name":"ICMR '26: International Conference on Multimedia Retrieval","location":"Amsterdam The Netherlands","acronym":"ICMR '26","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 2026 International Conference on Multimedia Retrieval"],"original-title":[],"deposited":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T15:46:40Z","timestamp":1781538400000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3805622.3810616"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,15]]},"references-count":48,"alternative-id":["10.1145\/3805622.3810616","10.1145\/3805622"],"URL":"https:\/\/doi.org\/10.1145\/3805622.3810616","relation":{},"subject":[],"published":{"date-parts":[[2026,6,15]]},"assertion":[{"value":"2026-06-15","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}