{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,6]],"date-time":"2026-08-06T14:21:54Z","timestamp":1786026114310,"version":"3.56.0"},"reference-count":57,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2027,1,1]],"date-time":"2027-01-01T00:00:00Z","timestamp":1798761600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100004731","name":"Zhejiang Province Natural Science Foundation","doi-asserted-by":"publisher","award":["ZCLZ24F0301"],"award-info":[{"award-number":["ZCLZ24F0301"]}],"id":[{"id":"10.13039\/501100004731","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62076083"],"award-info":[{"award-number":["62076083"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neural Networks"],"published-print":{"date-parts":[[2027,1]]},"DOI":"10.1016\/j.neunet.2026.109318","type":"journal-article","created":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T15:00:11Z","timestamp":1783090811000},"page":"109318","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PA","title":["EEG fine-grained visual semantic decoding via a multimodal framework"],"prefix":"10.1016","volume":"205","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-3855-0214","authenticated-orcid":false,"given":"Wenjie","family":"Cheng","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dongguan","family":"Qian","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lizhi","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaolong","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Pengji","family":"Jing","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5936-9775","authenticated-orcid":false,"given":"Hong","family":"Zeng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"10","key":"10.1016\/j.neunet.2026.109318_bib0001","doi-asserted-by":"crossref","first-page":"355","DOI":"10.14569\/IJACSA.2017.081046","article-title":"Emotion recognition based on EEG using LSTM recurrent neural network","volume":"8","author":"Alhagry","year":"2017","journal-title":"International Journal of Advanced Computer Science and Applications"},{"key":"10.1016\/j.neunet.2026.109318_bib0002","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2022.108757","article-title":"EEG-convtransformer for single-trial EEG-based visual stimulus classification","volume":"129","author":"Bagchi","year":"2022","journal-title":"Pattern Recognition"},{"key":"10.1016\/j.neunet.2026.109318_bib0003","unstructured":"Bai, S., Cai, Y., Chen, R., Chen, K., Chen, X.-H., Cheng, Z., Deng, L., Ding, W., Fang, R., Gao, C., Ge, C., Ge, W., Guo, Z., Huang, Q., Huang, Q., Huang, F., Hui, B., Jiang, S., Li, Z.,... Zhu, K. (2025). Qwen3-VL technical report. abs\/2511.21631. https:\/\/api.semanticscholar.org\/CorpusID:283262018."},{"key":"10.1016\/j.neunet.2026.109318_bib0004","unstructured":"Bai, Y., Wang, X., Cao, Y.-p., Ge, Y., Yuan, C., & Shan, Y. (2023). Dreamdiffusion: Generating high-quality images from brain EEG signals (2023). arXiv preprint arXiv: 2306.16934."},{"key":"10.1016\/j.neunet.2026.109318_bib0005","unstructured":"Bashivan, P., Rish, I., Yeasin, M., & Codella, N. (2015). Learning representations from EEG with deep recurrent-convolutional neural networks. arXiv preprint arXiv: 1511.06448."},{"issue":"10","key":"10.1016\/j.neunet.2026.109318_bib0006","doi-asserted-by":"crossref","DOI":"10.1167\/11.10.9","article-title":"High temporal resolution decoding of object position and category","volume":"11","author":"Carlson","year":"2011","journal-title":"Journal of Vision"},{"issue":"10","key":"10.1016\/j.neunet.2026.109318_bib0007","doi-asserted-by":"crossref","first-page":"11302","DOI":"10.1609\/aaai.v38i10.29009","article-title":"Bridging the semantic latent space between brain and machine: Similarity is all you need","volume":"38","author":"Chen","year":"2024","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"10.1016\/j.neunet.2026.109318_bib0008","unstructured":"Choi, M., & Ishikawa, H. (2024). Braindecoder: Style-based visual decoding of EEG signals. arXiv preprint arXiv: 2409.05279."},{"issue":"3","key":"10.1016\/j.neunet.2026.109318_bib0009","doi-asserted-by":"crossref","first-page":"287","DOI":"10.1016\/0165-1684(94)90029-9","article-title":"Independent component analysis, a new concept?","volume":"36","author":"Comon","year":"1994","journal-title":"Signal Processing"},{"issue":"4","key":"10.1016\/j.neunet.2026.109318_bib0010","doi-asserted-by":"crossref","first-page":"1425","DOI":"10.1016\/j.neuroimage.2010.03.030","article-title":"Predicting variations of perceptual performance across individuals from neural activity using pattern classifiers","volume":"51","author":"Das","year":"2010","journal-title":"Neuroimage"},{"key":"10.1016\/j.neunet.2026.109318_bib0011","doi-asserted-by":"crossref","first-page":"532","DOI":"10.1016\/j.eswa.2018.08.031","article-title":"An end-to-end deep learning approach to MI-EEG signal classification for BCIs","volume":"114","author":"Dose","year":"2018","journal-title":"Expert Systems with Applications"},{"issue":"9","key":"10.1016\/j.neunet.2026.109318_bib0012","doi-asserted-by":"crossref","first-page":"10760","DOI":"10.1109\/TPAMI.2023.3263181","article-title":"Decoding visual neural representations by multimodal learning of brain-visual-linguistic features","volume":"45","author":"Du","year":"2023","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"10.1016\/j.neunet.2026.109318_bib0013","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"12873","article-title":"Taming transformers for high-resolution image synthesis","author":"Esser","year":"2021"},{"key":"10.1016\/j.neunet.2026.109318_bib0014","series-title":"Proceedings of the 28th ACM international conference on multimedia","first-page":"1764","article-title":"Brain-media: A dual conditioned and lateralization supported GAN (DCLS-GAN) towards visualization of image-evoked brain activities","author":"Fares","year":"2020"},{"key":"10.1016\/j.neunet.2026.109318_bib0015","series-title":"ICASSP 2025-2025 IEEE International conference on acoustics, speech and signal processing","first-page":"1","article-title":"BrainVis: Exploring the bridge between brain and visual signals via image reconstruction","author":"Fu","year":"2025"},{"issue":"11","key":"10.1016\/j.neunet.2026.109318_bib0016","doi-asserted-by":"crossref","first-page":"139","DOI":"10.1145\/3422622","article-title":"Generative adversarial networks","volume":"63","author":"Goodfellow","year":"2020","journal-title":"Communications of the ACM"},{"key":"10.1016\/j.neunet.2026.109318_bib0017","unstructured":"Hessel, J., Holtzman, A., Forbes, M., Bras, R. L., & Choi, Y. (2022). Clipscore: A reference-free evaluation metric for image captioning. https:\/\/arxiv.org\/abs\/2104.08718."},{"key":"10.1016\/j.neunet.2026.109318_bib0018","series-title":"Advances in neural information processing systems","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume":"vol. 33","author":"Ho","year":"2020"},{"issue":"8","key":"10.1016\/j.neunet.2026.109318_bib0019","doi-asserted-by":"crossref","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","article-title":"Long short-term memory","volume":"9","author":"Hochreiter","year":"1997","journal-title":"Neural Computation"},{"key":"10.1016\/j.neunet.2026.109318_bib0020","doi-asserted-by":"crossref","first-page":"60","DOI":"10.1016\/j.bspc.2016.01.013","article-title":"Decoding of object categories from brain signals using cross frequency coupling methods","volume":"27","author":"Jafakesh","year":"2016","journal-title":"Biomedical Signal Processing and Control"},{"key":"10.1016\/j.neunet.2026.109318_bib0021","series-title":"2018 3rd IEEE International conference on recent trends in electronics, information & communication technology","first-page":"2319","article-title":"Feature extraction using convolution neural networks (CNN) and deep learning","author":"Jogin","year":"2018"},{"key":"10.1016\/j.neunet.2026.109318_bib0022","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"8110","article-title":"Analyzing and improving the image quality of stylegan","author":"Karras","year":"2020"},{"key":"10.1016\/j.neunet.2026.109318_bib0023","series-title":"Proceedings of the 25th ACM international conference on multimedia","first-page":"1809","article-title":"Brain2image: Converting brain signals into images","author":"Kavasidis","year":"2017"},{"key":"10.1016\/j.neunet.2026.109318_bib0024","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"2426","article-title":"DiffusionCLIP: Text-guided diffusion models for robust image manipulation","author":"Kim","year":"2022"},{"key":"10.1016\/j.neunet.2026.109318_bib0025","unstructured":"Kingma, D. P. (2013). Auto-encoding variational bayes. arXiv preprint arXiv: 1312.6114."},{"issue":"6","key":"10.1016\/j.neunet.2026.109318_bib0026","doi-asserted-by":"crossref","first-page":"84","DOI":"10.1145\/3065386","article-title":"Imagenet classification with deep convolutional neural networks","volume":"60","author":"Krizhevsky","year":"2017","journal-title":"Communications of the ACM"},{"issue":"21","key":"10.1016\/j.neunet.2026.109318_bib0027","doi-asserted-by":"crossref","first-page":"32259","DOI":"10.1007\/s11042-023-14769-4","article-title":"Visually evoked brain signals guided image regeneration using GAN variants","volume":"82","author":"Kumari","year":"2023","journal-title":"Multimedia Tools and Applications"},{"key":"10.1016\/j.neunet.2026.109318_bib0028","unstructured":"Lan, Y.-T., Ren, K., Wang, Y., Zheng, W.-L., Li, D., Lu, B.-L., & Qiu, L. (2023). Seeing through the brain: Image reconstruction of visual perception from human brain signals. arXiv preprint arXiv: 2308.02510."},{"key":"10.1016\/j.neunet.2026.109318_bib0029","doi-asserted-by":"crossref","unstructured":"Li, D., Wei, C., Li, S., Zou, J., Qin, H., & Liu, Q. (2024). Visual decoding and reconstruction via EEG embeddings with guided diffusion. arXiv preprint arXiv: 2403.07721.","DOI":"10.52202\/079017-3266"},{"key":"10.1016\/j.neunet.2026.109318_bib0030","series-title":"International conference on machine learning","first-page":"12888","article-title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","author":"Li","year":"2022"},{"key":"10.1016\/j.neunet.2026.109318_bib0031","series-title":"Human brain and artificial intelligence","first-page":"248","article-title":"Visualizing emotional states: A method based on human brain activity","author":"Long","year":"2019"},{"key":"10.1016\/j.neunet.2026.109318_bib0032","series-title":"ICASSP 2025-2025 IEEE International conference on acoustics, speech and signal processing","first-page":"1","article-title":"Guess what i think: Streamlined EEG-to-image generation with latent diffusion models","author":"Lopez","year":"2025"},{"key":"10.1016\/j.neunet.2026.109318_bib0033","series-title":"International conference on machine learning","first-page":"8162","article-title":"Improved denoising diffusion probabilistic models","author":"Nichol","year":"2021"},{"key":"10.1016\/j.neunet.2026.109318_bib0034","series-title":"Proceedings of the IEEE international conference on computer vision","first-page":"3410","article-title":"Generative adversarial networks conditioned by brain signals","author":"Palazzo","year":"2017"},{"key":"10.1016\/j.neunet.2026.109318_bib0035","doi-asserted-by":"crossref","DOI":"10.1016\/j.cmpb.2024.108213","article-title":"NeuroDM: Decoding and visualizing human brain activity with EEG-guided diffusion model","volume":"251","author":"Qian","year":"2024","journal-title":"Computer Methods and Programs in Biomedicine"},{"key":"10.1016\/j.neunet.2026.109318_bib0036","series-title":"Proceedings of the 2019 international conference on artificial intelligence and computer science","first-page":"265","article-title":"Deep spatial-temporal neural network for classification of EEG-based motor imagery","author":"Qiao","year":"2019"},{"key":"10.1016\/j.neunet.2026.109318_bib0037","series-title":"International conference on machine learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.neunet.2026.109318_bib0038","series-title":"Advances in neural information processing systems","article-title":"Generating diverse high-fidelity images with VQ-VAE-2","author":"Razavi","year":"2019"},{"key":"10.1016\/j.neunet.2026.109318_bib0039","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"10684","article-title":"High-resolution image synthesis with latent diffusion models","author":"Rombach","year":"2022"},{"key":"10.1016\/j.neunet.2026.109318_bib0040","series-title":"2019 Asia-pacific signal and information processing association annual summit and conference","first-page":"939","article-title":"Hybrid convolutional recurrent neural networks outperform CNN and RNN in task-state EEG detection for parkinson\u2019s disease","author":"Shi","year":"2019"},{"key":"10.1016\/j.neunet.2026.109318_bib0041","series-title":"Proceedings of the IEEE\/CVF winter conference on applications of computer vision","first-page":"7553","article-title":"Learning robust deep visual representations from EEG brain recordings","author":"Singh","year":"2024"},{"key":"10.1016\/j.neunet.2026.109318_bib0042","doi-asserted-by":"crossref","first-page":"710","DOI":"10.1109\/TNSRE.2022.3230250","article-title":"EEG conformer: Convolutional transformer for EEG decoding and visualization","volume":"31","author":"Song","year":"2022","journal-title":"IEEE Transactions on Neural Systems and Rehabilitation Engineering"},{"key":"10.1016\/j.neunet.2026.109318_bib0043","series-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","first-page":"6809","article-title":"Deep learning human mind for automated visual classification","author":"Spampinato","year":"2017"},{"key":"10.1016\/j.neunet.2026.109318_bib0044","doi-asserted-by":"crossref","first-page":"555","DOI":"10.1007\/s11571-019-09556-7","article-title":"Functional and effective connectivity based features of EEG signals for object recognition","volume":"13","author":"Tafreshi","year":"2019","journal-title":"Cognitive Neurodynamics"},{"key":"10.1016\/j.neunet.2026.109318_bib0045","doi-asserted-by":"crossref","first-page":"33","DOI":"10.1007\/s10548-014-0371-9","article-title":"Decoding objects of basic categories from electroencephalographic signals using wavelet transform and support vector machines","volume":"28","author":"Taghizadeh-Sarabi","year":"2015","journal-title":"Brain Topography"},{"key":"10.1016\/j.neunet.2026.109318_bib0046","series-title":"2017\u202fIEEE International conference on systems, man, and cybernetics","first-page":"234","article-title":"Deep learning-based classification for brain-computer interfaces","author":"Thomas","year":"2017"},{"key":"10.1016\/j.neunet.2026.109318_bib0047","series-title":"Advances in neural information processing systems","article-title":"Attention is all you need","volume":"vol. 30","author":"Vaswani","year":"2017"},{"issue":"11","key":"10.1016\/j.neunet.2026.109318_bib0048","doi-asserted-by":"crossref","first-page":"2086","DOI":"10.1109\/TNSRE.2018.2876129","article-title":"LSTM-based EEG classification in motor imagery tasks","volume":"26","author":"Wang","year":"2018","journal-title":"IEEE Transactions on Neural Systems and Rehabilitation Engineering"},{"key":"10.1016\/j.neunet.2026.109318_bib0049","series-title":"2020\u202fIEEE International symposium on medical measurements and applications","first-page":"1","article-title":"An accurate EEGNet-based motor-imagery brain\u2013computer interface for low-power edge computing","author":"Wang","year":"2020"},{"key":"10.1016\/j.neunet.2026.109318_bib0050","series-title":"Proceedings of the 32nd ACM international conference on multimedia","first-page":"8992","article-title":"MB2C: Multimodal bidirectional cycle consistency for learning robust visual neural representations","author":"Wei","year":"2024"},{"key":"10.1016\/j.neunet.2026.109318_bib0051","doi-asserted-by":"crossref","first-page":"2126","DOI":"10.1109\/TNSRE.2022.3194600","article-title":"A transformer-based approach combining deep learning network and spatial-temporal information for raw EEG classification","volume":"30","author":"Xie","year":"2022","journal-title":"IEEE Transactions on Neural Systems and Rehabilitation Engineering"},{"key":"10.1016\/j.neunet.2026.109318_bib0052","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"19187","article-title":"Language in a bottle: Language model guided concept bottlenecks for interpretable image classification","author":"Yang","year":"2023"},{"key":"10.1016\/j.neunet.2026.109318_bib0053","doi-asserted-by":"crossref","DOI":"10.1016\/j.bspc.2023.105125","article-title":"DM-RE2I: A framework based on diffusion model for the reconstruction from EEG to image","volume":"86","author":"Zeng","year":"2023","journal-title":"Biomedical Signal Processing and Control"},{"key":"10.1016\/j.neunet.2026.109318_bib0054","doi-asserted-by":"crossref","DOI":"10.1016\/j.bspc.2022.104440","article-title":"DCAE: A dual conditional autoencoder framework for the reconstruction from EEG into image","volume":"81","author":"Zeng","year":"2023","journal-title":"Biomedical Signal Processing and Control"},{"issue":"1","key":"10.1016\/j.neunet.2026.109318_bib0055","doi-asserted-by":"crossref","first-page":"31","DOI":"10.1109\/TNSRE.2018.2884641","article-title":"Learning spatial\u2013spectral\u2013temporal EEG features with recurrent 3D convolutional neural networks for cross-task mental workload assessment","volume":"27","author":"Zhang","year":"2018","journal-title":"IEEE Transactions on Neural Systems and Rehabilitation Engineering"},{"key":"10.1016\/j.neunet.2026.109318_bib0056","series-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","article-title":"The unreasonable effectiveness of deep features as a perceptual metric","author":"Zhang","year":"2018"},{"key":"10.1016\/j.neunet.2026.109318_bib0057","doi-asserted-by":"crossref","DOI":"10.1016\/j.bspc.2019.101730","article-title":"Decoding human brain activity with deep learning","volume":"56","author":"Zheng","year":"2020","journal-title":"Biomedical Signal Processing and Control"}],"container-title":["Neural Networks"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0893608026007781?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0893608026007781?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,8,6]],"date-time":"2026-08-06T13:13:12Z","timestamp":1786021992000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0893608026007781"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2027,1]]},"references-count":57,"alternative-id":["S0893608026007781"],"URL":"https:\/\/doi.org\/10.1016\/j.neunet.2026.109318","relation":{},"ISSN":["0893-6080"],"issn-type":[{"value":"0893-6080","type":"print"}],"subject":[],"published":{"date-parts":[[2027,1]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"EEG fine-grained visual semantic decoding via a multimodal framework","name":"articletitle","label":"Article Title"},{"value":"Neural Networks","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neunet.2026.109318","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"109318"}}