{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T23:48:13Z","timestamp":1782863293833,"version":"3.54.5"},"reference-count":53,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100005230","name":"Chongqing Natural Science Foundation","doi-asserted-by":"publisher","award":["CSTB2024NSCQ-MSX0663"],"award-info":[{"award-number":["CSTB2024NSCQ-MSX0663"]}],"id":[{"id":"10.13039\/501100005230","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neural Networks"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.neunet.2026.109293","type":"journal-article","created":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T07:35:59Z","timestamp":1782372959000},"page":"109293","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Integrating visual and language cues via state space models for medical image segmentation"],"prefix":"10.1016","volume":"204","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2056-6154","authenticated-orcid":false,"given":"Mingyang","family":"Hou","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhiyong","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Daidi","family":"Zhong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhi","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaoyu","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiahong","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yan","family":"Yan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yushi","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Min","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.neunet.2026.109293_bib0001","doi-asserted-by":"crossref","DOI":"10.1016\/j.bspc.2025.107850","article-title":"TransUMobilenet: Integrating multi-channel attention fusion with hybrid CNN-transformer architecture for medical image segmentation","volume":"107","author":"Cai","year":"2025","journal-title":"Biomedical Signal Processing and Control"},{"key":"10.1016\/j.neunet.2026.109293_bib0002","series-title":"European conference on computer vision","first-page":"205","article-title":"Swin-Unet: Unet-like pure transformer for medical image segmentation","author":"Cao","year":"2022"},{"key":"10.1016\/j.neunet.2026.109293_bib0003","series-title":"Proceedings of the 28th international conference on computational linguistics","first-page":"669","article-title":"BioMedBERT: A pre-trained biomedical language model for QA and IR","author":"Chakraborty","year":"2020"},{"key":"10.1016\/j.neunet.2026.109293_bib0004","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2024.103280","article-title":"TransUNet: Rethinking the U-Net architecture design for medical image segmentation through the lens of transformers","volume":"97","author":"Chen","year":"2024","journal-title":"Medical Image Analysis"},{"key":"10.1016\/j.neunet.2026.109293_bib0005","series-title":"2022\u202fIEEE International conference on image processing (ICIP)","first-page":"2306","article-title":"OSegNet: Operational segmentation network for covid-19 detection using chest X-ray images","author":"Degerli","year":"2022"},{"key":"10.1016\/j.neunet.2026.109293_bib0006","series-title":"2008\u202fIEEE International conference on fuzzy systems (IEEE world congress on computational intelligence)","first-page":"1729","article-title":"Fuzzy integral for moving object detection","author":"El Baf","year":"2008"},{"key":"10.1016\/j.neunet.2026.109293_bib0007","series-title":"Proceedings of medical image computing and computer assisted intervention \u2013 MICCAI 2024","article-title":"Enhancing label-efficient medical image segmentation with text-guided diffusion models","volume":"LNCS 15008","author":"Feng","year":"2024"},{"key":"10.1016\/j.neunet.2026.109293_bib0008","doi-asserted-by":"crossref","DOI":"10.1016\/j.bspc.2025.107855","article-title":"Medical priors-guided feature learning network on multimodal imaging raw data for brain tumor segmentation","volume":"107","author":"Feng","year":"2025","journal-title":"Biomedical Signal Processing and Control"},{"key":"10.1016\/j.neunet.2026.109293_bib0009","series-title":"First conference on language modeling","article-title":"Mamba: Linear-time sequence modeling with selective state spaces","author":"Gu","year":"2024"},{"key":"10.1016\/j.neunet.2026.109293_bib0010","unstructured":"Gu, A., Goel, K., & R\u00e9, C. (2021). Efficiently modeling long sequences with structured state spaces. arXiv: 2111.00396."},{"key":"10.1016\/j.neunet.2026.109293_bib0011","doi-asserted-by":"crossref","DOI":"10.1016\/j.compbiomed.2024.108709","article-title":"A survey on advancements in image-text multimodal models: From general techniques to biomedical implementations","volume":"178","author":"Guo","year":"2024","journal-title":"Computers in Biology and Medicine"},{"key":"10.1016\/j.neunet.2026.109293_bib0012","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110491","article-title":"UCTNet: Uncertainty-guided CNN-transformer hybrid networks for medical image segmentation","volume":"152","author":"Guo","year":"2024","journal-title":"Pattern Recognition"},{"key":"10.1016\/j.neunet.2026.109293_bib0013","series-title":"Ordinary differential equations","author":"Hartman","year":"2002"},{"issue":"11","key":"10.1016\/j.neunet.2026.109293_bib0014","doi-asserted-by":"crossref","DOI":"10.3348\/kjr.2023.0393","article-title":"Overcoming the challenges in the development and implementation of artificial intelligence in radiology: A comprehensive review of solutions beyond supervised learning","volume":"24","author":"Hong","year":"2023","journal-title":"Korean Journal of Radiology"},{"key":"10.1016\/j.neunet.2026.109293_bib0015","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"4067","article-title":"Beyond one-to-one: Rethinking the referring image segmentation","author":"Hu","year":"2023"},{"key":"10.1016\/j.neunet.2026.109293_bib0016","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111274","article-title":"kMaXU: Medical image segmentation U-Net with k-means mask transformer and contrastive cluster assignment","volume":"161","author":"Huang","year":"2025","journal-title":"Pattern Recognition"},{"key":"10.1016\/j.neunet.2026.109293_bib0017","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2024.103223","article-title":"A review of uncertainty quantification in medical image analysis: Probabilistic and non-probabilistic methods","volume":"97","author":"Huang","year":"2024","journal-title":"Medical Image Analysis"},{"key":"10.1016\/j.neunet.2026.109293_bib0018","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"3942","article-title":"Gloria: A multimodal global-local representation learning framework for label-efficient medical image recognition","author":"Huang","year":"2021"},{"issue":"4","key":"10.1016\/j.neunet.2026.109293_bib0019","doi-asserted-by":"crossref","first-page":"1821","DOI":"10.1109\/TMI.2024.3523333","article-title":"Cross-modal conditioned reconstruction for language-guided medical image segmentation","volume":"44","author":"Huang","year":"2025","journal-title":"IEEE Transactions on Medical Imaging"},{"issue":"2","key":"10.1016\/j.neunet.2026.109293_bib0020","doi-asserted-by":"crossref","first-page":"203","DOI":"10.1038\/s41592-020-01008-z","article-title":"nnU-Net: A self-configuring method for deep learning-based biomedical image segmentation","volume":"18","author":"Isensee","year":"2021","journal-title":"Nature Methods"},{"key":"10.1016\/j.neunet.2026.109293_bib0021","series-title":"International conference on machine learning","first-page":"5583","article-title":"ViLT: Vision-and-language transformer without convolution or region supervision","author":"Kim","year":"2021"},{"issue":"5","key":"10.1016\/j.neunet.2026.109293_bib0022","doi-asserted-by":"crossref","first-page":"1380","DOI":"10.1109\/TMI.2019.2947628","article-title":"A multi-organ nucleus segmentation challenge","volume":"39","author":"Kumar","year":"2019","journal-title":"IEEE Transactions on Medical Imaging"},{"issue":"1","key":"10.1016\/j.neunet.2026.109293_bib0023","doi-asserted-by":"crossref","first-page":"11","DOI":"10.1016\/S0165-0114(02)00429-3","article-title":"The choquet integral for the aggregation of interval scales in multicriteria decision making","volume":"137","author":"Labreuche","year":"2003","journal-title":"Fuzzy Sets and Systems"},{"key":"10.1016\/j.neunet.2026.109293_bib0024","doi-asserted-by":"crossref","DOI":"10.1016\/j.compbiomed.2025.110297","article-title":"Text-guided cross-position attention for image analysis: Case of medical image","volume":"193","author":"Lee","year":"2025","journal-title":"Computers in Biology and Medicine"},{"issue":"1","key":"10.1016\/j.neunet.2026.109293_bib0025","doi-asserted-by":"crossref","first-page":"96","DOI":"10.1109\/TMI.2023.3291719","article-title":"LViT: Language meets vision transformer in medical image segmentation","volume":"43","author":"Li","year":"2023","journal-title":"IEEE Transactions on Medical Imaging"},{"issue":"10","key":"10.1016\/j.neunet.2026.109293_bib0026","doi-asserted-by":"crossref","first-page":"3898","DOI":"10.1109\/TMI.2024.3508698","article-title":"Swin-UMamba\u2020: Adapting Mamba-based vision foundation models for medical image segmentation","volume":"44","author":"Liu","year":"2025","journal-title":"IEEE Transactions on Medical Imaging"},{"key":"10.1016\/j.neunet.2026.109293_bib0027","doi-asserted-by":"crossref","first-page":"103031","DOI":"10.52202\/079017-3273","article-title":"VMamba: Visual state space model","volume":"37","author":"Liu","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10.1016\/j.neunet.2026.109293_bib0028","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (CVPR)","article-title":"A convnet for the 2020s","author":"Liu","year":"2022"},{"key":"10.1016\/j.neunet.2026.109293_bib0029","series-title":"Advances in Neural Information Processing Systems","article-title":"ViLBERT: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","volume":"32","author":"Lu","year":"2019"},{"issue":"1","key":"10.1016\/j.neunet.2026.109293_bib0030","article-title":"Segment anything in medical images","volume":"15","author":"Ma","year":"2024","journal-title":"Nature Communications"},{"key":"10.1016\/j.neunet.2026.109293_bib0031","unstructured":"Ma, J., Li, F., & Wang, B. (2024b). U-Mamba: Enhancing long-range dependency for biomedical image segmentation. arXiv: 2401.04722."},{"key":"10.1016\/j.neunet.2026.109293_bib0032","first-page":"1","article-title":"RS3Mamba: Visual state space model for remote sensing image semantic segmentation","volume":"21","author":"Ma","year":"2024","journal-title":"IEEE Geoscience and Remote Sensing Letters"},{"issue":"12","key":"10.1016\/j.neunet.2026.109293_bib0033","doi-asserted-by":"crossref","first-page":"16411","DOI":"10.1007\/s11042-022-12484-0","article-title":"Truncating fined-tuned vision-based models to lightweight deployable diagnostic tools for SARS-CoV-2 infected chest X-rays and CT-scans","volume":"81","author":"Montalbo","year":"2022","journal-title":"Multimedia Tools and Applications"},{"issue":"1","key":"10.1016\/j.neunet.2026.109293_bib0034","doi-asserted-by":"crossref","DOI":"10.1186\/s13104-022-06096-y","article-title":"Towards a guideline for evaluation metrics in medical image segmentation","volume":"15","author":"M\u00fcller","year":"2022","journal-title":"BMC Research Notes"},{"key":"10.1016\/j.neunet.2026.109293_bib0035","series-title":"IJCAI","first-page":"1294","article-title":"SLViT: Scale-wise language-guided vision transformer for referring image segmentation","author":"Ouyang","year":"2023"},{"key":"10.1016\/j.neunet.2026.109293_bib0036","series-title":"International conference on machine learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.neunet.2026.109293_bib0037","series-title":"Medical image computing and computer-assisted intervention\u2013MICCAI 2015: 18th international conference, munich, germany, october 5\u20139, 2015, proceedings, part III 18","first-page":"234","article-title":"U-Net: Convolutional networks for biomedical image segmentation","author":"Ronneberger","year":"2015"},{"key":"10.1016\/j.neunet.2026.109293_bib0038","series-title":"2024\u202fIEEE 17th international symposium on embedded multicore\/many-core systems-on-chip (MCSoc)","first-page":"32","article-title":"Improving long text classification based on selective state space model (Mamba)","author":"Sarem","year":"2024"},{"key":"10.1016\/j.neunet.2026.109293_bib0039","series-title":"Proceedings of the IEEE international conference on computer vision","first-page":"618","article-title":"Grad-CAM: Visual explanations from deep networks via gradient-based localization","author":"Selvaraju","year":"2017"},{"key":"10.1016\/j.neunet.2026.109293_bib0040","doi-asserted-by":"crossref","first-page":"3169","DOI":"10.1109\/TIP.2025.3571672","article-title":"STPNet: Scale-aware text prompt network for medical image segmentation","volume":"34","author":"Shan","year":"2025","journal-title":"IEEE Transactions on Image Processing"},{"key":"10.1016\/j.neunet.2026.109293_bib0041","unstructured":"Sim\u00e9oni, O., Vo, H. V., Seitzer, M., Baldassarre, F., Oquab, M., Jose, C., Khalidov, V., Szafraniec, M., Yi, S., Ramamonjisoa, M., Massa, F., Haziza, D., Wehrstedt, L., Wang, J., Darcet, T., Moutakanni, T., Sentana, L., Roberts, C., Vedaldi, A., Tolan, J., Brandt, J., Couprie, C., Mairal, J., J\u00e9gou, H., Labatut, P., & Bojanowski, P. (2025). DINOv3. arXiv: 2508.10104."},{"key":"10.1016\/j.neunet.2026.109293_bib0042","series-title":"International conference on medical image computing and computer-assisted intervention","first-page":"151","article-title":"TGANet: Text-guided attention for improved polyp segmentation","author":"Tomar","year":"2022"},{"key":"10.1016\/j.neunet.2026.109293_bib0043","series-title":"Advances in Neural Information Processing Systems","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017"},{"key":"10.1016\/j.neunet.2026.109293_bib0044","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"2441","article-title":"UCTransNet: Rethinking the skip connections in u-net from a channel-wise perspective with transformer","volume":"36","author":"Wang","year":"2022"},{"key":"10.1016\/j.neunet.2026.109293_bib0045","series-title":"Medical image computing and computer assisted intervention \u2013 MICCAI 2024","first-page":"578","article-title":"SegMamba: Long-range sequential modeling mamba for 3d medical image segmentation","author":"Xing","year":"2024"},{"key":"10.1016\/j.neunet.2026.109293_bib0046","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"18155","article-title":"LAVT: Language-aware vision transformer for referring image segmentation","author":"Yang","year":"2022"},{"key":"10.1016\/j.neunet.2026.109293_bib0047","doi-asserted-by":"crossref","DOI":"10.1016\/j.energy.2024.130419","article-title":"Uncertainty-aware deep learning for reliable health monitoring in safety-critical energy systems","volume":"291","author":"Yao","year":"2024","journal-title":"Energy"},{"key":"10.1016\/j.neunet.2026.109293_bib0048","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"19456","article-title":"Zero-shot referring image segmentation with global-local context features","author":"Yu","year":"2023"},{"key":"10.1016\/j.neunet.2026.109293_bib0049","unstructured":"Zhang, Y., Hu, S., Jiang, C., Cheng, Y., & Qi, Y. (2023). Segment anything model with uncertainty rectification for auto-prompting medical image segmentation. 3, CoRR.arXiv: 2311.10529."},{"key":"10.1016\/j.neunet.2026.109293_bib0050","series-title":"Machine learning for healthcare conference","first-page":"2","article-title":"Contrastive learning of medical visual representations from paired images and text","author":"Zhang","year":"2022"},{"key":"10.1016\/j.neunet.2026.109293_bib0051","doi-asserted-by":"crossref","DOI":"10.1016\/j.compbiomed.2024.108238","article-title":"Segment anything model for medical image segmentation: Current applications and future directions","volume":"171","author":"Zhang","year":"2024","journal-title":"Computers in Biology and Medicine"},{"key":"10.1016\/j.neunet.2026.109293_bib0052","series-title":"Medical image computing and computer assisted intervention \u2013 MICCAI 2023","first-page":"724","article-title":"Ariadne\u2019s thread: Using text prompts to improve segmentation of infected areas from chest X-ray images","author":"Zhong","year":"2023"},{"key":"10.1016\/j.neunet.2026.109293_bib0053","first-page":"3","article-title":"UNet++: A nested U-Net architecture for medical image segmentation","author":"Zhou","year":"2018"}],"container-title":["Neural Networks"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0893608026007537?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0893608026007537?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T22:54:07Z","timestamp":1782860047000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0893608026007537"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":53,"alternative-id":["S0893608026007537"],"URL":"https:\/\/doi.org\/10.1016\/j.neunet.2026.109293","relation":{},"ISSN":["0893-6080"],"issn-type":[{"value":"0893-6080","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Integrating visual and language cues via state space models for medical image segmentation","name":"articletitle","label":"Article Title"},{"value":"Neural Networks","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neunet.2026.109293","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"109293"}}