{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T15:55:28Z","timestamp":1781538928392,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":46,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T00:00:00Z","timestamp":1781481600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,6,16]]},"DOI":"10.1145\/3805622.3810688","type":"proceedings-article","created":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T14:42:57Z","timestamp":1781534577000},"page":"2666-2675","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["TG-MUNet: A Lightweight Text-Guided Mamba Unet for Semi-Supervised Medical Image Segmentation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0009-5550-5202","authenticated-orcid":false,"given":"Feng","family":"Li","sequence":"first","affiliation":[{"name":"School of Computer and Information Engineering, Anhui University of Finance and Economics, Bengbu, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-9044-3006","authenticated-orcid":false,"given":"Chen","family":"Sun","sequence":"additional","affiliation":[{"name":"School of Computer and Information Engineering, Anhui University of Finance and Economics, Bengbu, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4945-7725","authenticated-orcid":false,"given":"Bing","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Computer and Information Engineering, Anhui University of Finance and Economics, Bengbu, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1359-5157","authenticated-orcid":false,"given":"Zongyu","family":"Xie","sequence":"additional","affiliation":[{"name":"Department of Radiology, The First Affiliated Hospital of Bengbu Medical University, Bengbu, Anhui, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,6,15]]},"reference":[{"key":"e_1_3_3_1_2_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_1"},{"key":"e_1_3_3_1_3_2","first-page":"205","volume-title":"European conference on computer vision","author":"Cao Hu","year":"2022","unstructured":"Hu Cao, Yueyue Wang, Joy Chen, Dongsheng Jiang, Xiaopeng Zhang, Qi Tian, and Manning Wang. 2022. Swin-unet: Unet-like pure transformer for medical image segmentation. In European conference on computer vision. Springer, 205\u2013218."},{"key":"e_1_3_3_1_4_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-43904-9_48"},{"key":"e_1_3_3_1_5_2","unstructured":"Jieneng Chen Yongyi Lu Qihang Yu Xiangde Luo Ehsan Adeli Yan Wang Le Lu Alan\u00a0L Yuille and Yuyin Zhou. 2021. Transunet: Transformers make strong encoders for medical image segmentation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2102.04306 (2021)."},{"key":"e_1_3_3_1_6_2","first-page":"424","volume-title":"International conference on medical image computing and computer-assisted intervention","author":"\u00c7i\u00e7ek \u00d6zg\u00fcn","year":"2016","unstructured":"\u00d6zg\u00fcn \u00c7i\u00e7ek, Ahmed Abdulkadir, Soeren\u00a0S Lienkamp, Thomas Brox, and Olaf Ronneberger. 2016. 3D U-Net: learning dense volumetric segmentation from sparse annotation. In International conference on medical image computing and computer-assisted intervention. Springer, 424\u2013432."},{"key":"e_1_3_3_1_7_2","unstructured":"Ian Covert Tony Sun James Zou and Tatsunori Hashimoto. 2024. Locality alignment improves vision-language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2410.11087 (2024)."},{"key":"e_1_3_3_1_8_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP46576.2022.9897412"},{"key":"e_1_3_3_1_9_2","first-page":"4171","volume-title":"Proceedings of the 2019 conference of the North American chapter of the association for computational linguistics: human language technologies, volume 1 (long and short papers)","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. Bert: Pre-training of deep bidirectional transformers for language understanding. In Proceedings of the 2019 conference of the North American chapter of the association for computational linguistics: human language technologies, volume 1 (long and short papers). 4171\u20134186."},{"key":"e_1_3_3_1_10_2","doi-asserted-by":"crossref","unstructured":"Foivos\u00a0I Diakogiannis Fran\u00e7ois Waldner Peter Caccetta and Chen Wu. 2020. ResUNet-a: A deep learning framework for semantic segmentation of remotely sensed data. ISPRS Journal of Photogrammetry and Remote Sensing 162 (2020) 94\u2013114.","DOI":"10.1016\/j.isprsjprs.2020.01.013"},{"key":"e_1_3_3_1_11_2","unstructured":"Alexey Dosovitskiy. 2020. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2010.11929 (2020)."},{"key":"e_1_3_3_1_12_2","volume-title":"First conference on language modeling","author":"Gu Albert","year":"2024","unstructured":"Albert Gu and Tri Dao. 2024. Mamba: Linear-time sequence modeling with selective state spaces. In First conference on language modeling."},{"key":"e_1_3_3_1_13_2","unstructured":"Albert Gu Karan Goel and Christopher R\u00e9. 2021. Efficiently modeling long sequences with structured state spaces. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2111.00396 (2021)."},{"key":"e_1_3_3_1_14_2","doi-asserted-by":"crossref","unstructured":"Steven Guan Amir\u00a0A Khan Siddhartha Sikdar and Parag\u00a0V Chitnis. 2019. Fully dense UNet for 2-D sparse photoacoustic tomography artifact removal. IEEE journal of biomedical and health informatics 24 2 (2019) 568\u2013576.","DOI":"10.1109\/JBHI.2019.2912935"},{"key":"e_1_3_3_1_15_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02228"},{"key":"e_1_3_3_1_16_2","doi-asserted-by":"crossref","unstructured":"Neeraj Kumar Ruchika Verma Sanuj Sharma Surabhi Bhargava Abhishek Vahadane and Amit Sethi. 2017. A dataset and a technique for generalized nuclear segmentation for computational pathology. IEEE transactions on medical imaging 36 7 (2017) 1550\u20131560.","DOI":"10.1109\/TMI.2017.2677499"},{"key":"e_1_3_3_1_17_2","doi-asserted-by":"crossref","unstructured":"Jinhyuk Lee Wonjin Yoon Sungdong Kim Donghyeon Kim Sunkyu Kim Chan\u00a0Ho So and Jaewoo Kang. 2020. BioBERT: a pre-trained biomedical language representation model for biomedical text mining. Bioinformatics 36 4 (2020) 1234\u20131240.","DOI":"10.1093\/bioinformatics\/btz682"},{"key":"e_1_3_3_1_18_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72120-5_8"},{"key":"e_1_3_3_1_19_2","doi-asserted-by":"crossref","unstructured":"Zihan Li Yunxiang Li Qingde Li Puyang Wang Dazhou Guo Le Lu Dakai Jin You Zhang and Qingqi Hong. 2023. Lvit: language meets vision transformer in medical image segmentation. IEEE transactions on medical imaging 43 1 (2023) 96\u2013107.","DOI":"10.1109\/TMI.2023.3291719"},{"key":"e_1_3_3_1_20_2","doi-asserted-by":"crossref","unstructured":"Ailiang Lin Bingzhi Chen Jiayu Xu Zheng Zhang Guangming Lu and David Zhang. 2022. Ds-transunet: Dual swin transformer u-net for medical image segmentation. IEEE Transactions on Instrumentation and Measurement 71 (2022) 1\u201315.","DOI":"10.1109\/TIM.2022.3178991"},{"key":"e_1_3_3_1_21_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72114-4_59"},{"key":"e_1_3_3_1_22_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49660.2025.10889117"},{"key":"e_1_3_3_1_23_2","unstructured":"Jun Ma Feifei Li and Bo Wang. 2024. U-mamba: Enhancing long-range dependency for biomedical image segmentation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2401.04722 (2024)."},{"key":"e_1_3_3_1_24_2","doi-asserted-by":"publisher","DOI":"10.1109\/3DV.2016.79"},{"key":"e_1_3_3_1_25_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_39"},{"key":"e_1_3_3_1_26_2","unstructured":"Qingtao Pan Zhengrong Li Wenhao Qiao Jingjiao Lou Qing Yang Guang Yang and Bing Ji. 2025. AMVLM: Alignment-Multiplicity Aware Vision-Language Model for Semi-Supervised Medical Image Segmentation. IEEE Transactions on Medical Imaging (2025)."},{"key":"e_1_3_3_1_27_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i6.32674"},{"key":"e_1_3_3_1_28_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11671"},{"key":"e_1_3_3_1_29_2","first-page":"8748","volume-title":"International conference on machine learning","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong\u00a0Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et\u00a0al. 2021. Learning transferable visual models from natural language supervision. In International conference on machine learning. PmLR, 8748\u20138763."},{"key":"e_1_3_3_1_30_2","doi-asserted-by":"crossref","unstructured":"Md\u00a0Motiur Rahman Saeka Rahman Smriti Bhatt and Miad Faezipour. 2025. Text-Assisted Vision Model for Medical Image Segmentation. IEEE Journal of Biomedical and Health Informatics (2025).","DOI":"10.1109\/JBHI.2025.3569491"},{"key":"e_1_3_3_1_31_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"e_1_3_3_1_32_2","doi-asserted-by":"crossref","unstructured":"Jiacheng Ruan Jincheng Li and Suncheng Xiang. 2024. Vm-unet: Vision mamba unet for medical image segmentation. ACM Transactions on Multimedia Computing Communications and Applications (2024).","DOI":"10.1145\/3767748"},{"key":"e_1_3_3_1_33_2","doi-asserted-by":"crossref","unstructured":"Ahmad\u00a0Waleed Salehi Shakir Khan Gaurav Gupta Bayan\u00a0Ibrahimm Alabduallah Abrar Almjally Hadeel Alsolai Tamanna Siddiqui and Adel Mellit. 2023. A study of CNN and transfer learning in medical imaging: Advantages challenges future scope. Sustainability 15 7 (2023) 5930.","DOI":"10.3390\/su15075930"},{"key":"e_1_3_3_1_34_2","first-page":"691","volume-title":"European Conference on Computer Vision","author":"Salpea Natalia","year":"2022","unstructured":"Natalia Salpea, Paraskevi Tzouveli, and Dimitrios Kollias. 2022. Medical image segmentation: A review of modern architectures. In European Conference on Computer Vision. Springer, 691\u2013708."},{"key":"e_1_3_3_1_35_2","unstructured":"Qingshan She Songkai Sun Yuliang Ma Rihui Li and Yingchun Zhang. 2024. LUCF-Net: Lightweight U-shaped cascade fusion network for medical image segmentation. IEEE Journal of Biomedical and Health Informatics (2024)."},{"key":"e_1_3_3_1_36_2","doi-asserted-by":"crossref","unstructured":"Dinggang Shen Guorong Wu and Heung-Il Suk. 2017. Deep learning in medical image analysis. Annual review of biomedical engineering 19 1 (2017) 221\u2013248.","DOI":"10.1146\/annurev-bioeng-071516-044442"},{"key":"e_1_3_3_1_37_2","doi-asserted-by":"crossref","unstructured":"Edwin Thomas SJ Pawan Shushant Kumar Anmol Horo S Niyas S Vinayagamani Chandrasekharan Kesavadas and Jeny Rajan. 2020. Multi-res-attention UNet: a CNN model for the segmentation of focal cortical dysplasia lesions from magnetic resonance images. IEEE journal of biomedical and health informatics 25 5 (2020) 1724\u20131734.","DOI":"10.1109\/JBHI.2020.3024188"},{"key":"e_1_3_3_1_38_2","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan\u00a0N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is all you need. Advances in neural information processing systems 30 (2017)."},{"key":"e_1_3_3_1_39_2","doi-asserted-by":"crossref","unstructured":"Fuying Wang Yuyin Zhou Shujun Wang Varut Vardhanabhuti and Lequan Yu. 2022. Multi-granularity cross-modal alignment for generalized medical visual representation learning. Advances in neural information processing systems 35 (2022) 33536\u201333549.","DOI":"10.52202\/068431-2430"},{"key":"e_1_3_3_1_40_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.emnlp-main.256"},{"key":"e_1_3_3_1_41_2","unstructured":"Ziyang Wang Jian-Qing Zheng Yichi Zhang Ge Cui and Lei Li. 2024. Mamba-unet: Unet-like pure visual mamba for medical image segmentation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2402.05079 (2024)."},{"key":"e_1_3_3_1_42_2","doi-asserted-by":"publisher","DOI":"10.1109\/ITME.2018.00080"},{"key":"e_1_3_3_1_43_2","doi-asserted-by":"crossref","unstructured":"Zhaohu Xing Tian Ye Yijun Yang Guang Liu and Lei Zhu. 2024. SegMamba: Long-range Sequential Modeling Mamba For 3D Medical Image Segmentation. LNCS 15008 (October 2024).","DOI":"10.1007\/978-3-031-72111-3_54"},{"key":"e_1_3_3_1_44_2","doi-asserted-by":"crossref","unstructured":"Chenyu You Ruihan Zhao Fenglin Liu Siyuan Dong Sandeep Chinchali Ufuk Topcu Lawrence Staib and James Duncan. 2022. Class-aware adversarial transformers for medical image segmentation. Advances in neural information processing systems 35 (2022) 29582\u201329596.","DOI":"10.52202\/068431-2145"},{"key":"e_1_3_3_1_45_2","doi-asserted-by":"crossref","unstructured":"Theodore Zhao Yu Gu Jianwei Yang Naoto Usuyama Ho\u00a0Hin Lee Sid Kiblawi Tristan Naumann Jianfeng Gao Angela Crabtree Jacob Abel et\u00a0al. 2025. A foundation model for joint segmentation detection and recognition of biomedical objects across nine modalities. Nature methods 22 1 (2025) 166\u2013176.","DOI":"10.1038\/s41592-024-02499-w"},{"key":"e_1_3_3_1_46_2","doi-asserted-by":"crossref","unstructured":"Zongwei Zhou Md\u00a0Mahfuzur\u00a0Rahman Siddiquee Nima Tajbakhsh and Jianming Liang. 2019. Unet++: Redesigning skip connections to exploit multiscale features in image segmentation. IEEE transactions on medical imaging 39 6 (2019) 1856\u20131867.","DOI":"10.1109\/TMI.2019.2959609"},{"key":"e_1_3_3_1_47_2","unstructured":"Lianghui Zhu Bencheng Liao Qian Zhang Xinlong Wang Wenyu Liu and Xinggang Wang. 2024. Vision mamba: Efficient visual representation learning with bidirectional state space model. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2401.09417 (2024)."}],"event":{"name":"ICMR '26: International Conference on Multimedia Retrieval","location":"Amsterdam The Netherlands","acronym":"ICMR '26","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 2026 International Conference on Multimedia Retrieval"],"original-title":[],"deposited":{"date-parts":[[2026,6,15]],"date-time":"2026-06-15T15:18:02Z","timestamp":1781536682000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3805622.3810688"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,15]]},"references-count":46,"alternative-id":["10.1145\/3805622.3810688","10.1145\/3805622"],"URL":"https:\/\/doi.org\/10.1145\/3805622.3810688","relation":{},"subject":[],"published":{"date-parts":[[2026,6,15]]},"assertion":[{"value":"2026-06-15","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}