{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T17:18:28Z","timestamp":1779383908502,"version":"3.53.1"},"reference-count":55,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.patcog.2026.113420","type":"journal-article","created":{"date-parts":[[2026,2,28]],"date-time":"2026-02-28T23:04:31Z","timestamp":1772319871000},"page":"113420","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"C","title":["Affective-aware fine-grained image quality assessment via multi-modal large language models"],"prefix":"10.1016","volume":"178","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-3286-9569","authenticated-orcid":false,"given":"Chenyue","family":"Song","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1872-5424","authenticated-orcid":false,"given":"Xianzhu","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3739-0973","authenticated-orcid":false,"given":"Chen","family":"Hui","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5076-2412","authenticated-orcid":false,"given":"Haiqi","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-2799-3297","authenticated-orcid":false,"given":"Yachun","family":"Mi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-3401-6607","authenticated-orcid":false,"given":"Kai","family":"Geng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-3442-8405","authenticated-orcid":false,"given":"Junwei","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-0343-8910","authenticated-orcid":false,"given":"Zhengyue","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8342-1211","authenticated-orcid":false,"given":"Feng","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113420_bib0001","article-title":"A comprehensive approach for image quality assessment using quality-centric embedding and ranking networks","volume":"173","author":"Haider","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113420_bib0002","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.110774","article-title":"CFNet: an infrared and visible image compression fusion network","volume":"156","author":"Xing","year":"2024","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113420_bib0003","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2022.108983","article-title":"Motion-blurred image restoration framework based on parameter estimation and fuzzy radial basis function neural networks","volume":"132","author":"Zhao","year":"2022","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113420_bib0004","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111022","article-title":"FICE: text-conditioned fashion-image editing with guided GAN inversion","volume":"158","author":"Pernu\u0161","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113420_bib0005","article-title":"Using dynamic knowledge for kernel modulation: towards image generation via one-shot multi-domain adaptation","volume":"172","author":"Zhang","year":"2025","journal-title":"Pattern Recognit."},{"issue":"9","key":"10.1016\/j.patcog.2026.113420_bib0006","doi-asserted-by":"crossref","first-page":"1948","DOI":"10.1364\/JOSAA.29.001948","article-title":"Influence of affective image content on subjective quality assessment","volume":"29","author":"van der Linde","year":"2012","journal-title":"J. Opt. Soc. Am. A"},{"issue":"1","key":"10.1016\/j.patcog.2026.113420_bib0007","doi-asserted-by":"crossref","DOI":"10.1038\/s41598-025-06386-y","article-title":"Emotion and sentiment enriched decision transformer for personalized recommendations","volume":"15","author":"Abakarim","year":"2025","journal-title":"Sci. Rep."},{"key":"10.1016\/j.patcog.2026.113420_bib0008","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"21321","article-title":"Bias-resilient weakly supervised semantic segmentation using normalizing flows","author":"Qiu","year":"2025"},{"issue":"1","key":"10.1016\/j.patcog.2026.113420_bib0009","doi-asserted-by":"crossref","first-page":"1","DOI":"10.4018\/IJSWIS.339187","article-title":"Affective prompt-tuning-based language model for semantic-based emotional text generation","volume":"20","author":"Gu","year":"2024","journal-title":"Int. J. Semant. Web Inf. Syst."},{"key":"10.1016\/j.patcog.2026.113420_bib0010","unstructured":"S. Bai, K. Chen, X. Liu, J. Wang, W. Ge, S. Song, K. Dang, P. Wang, S. Wang, J. Tang, et al., Qwen2. 5-vl technical report(2025). arXiv: 2502.13923."},{"key":"10.1016\/j.patcog.2026.113420_bib0011","unstructured":"D. Zhu, J. Chen, X. Shen, X. Li, M. Elhoseiny, MiniGPT-4: enhancing vision-language understanding with advanced large language models(2023). arXiv: 2304.10592."},{"key":"10.1016\/j.patcog.2026.113420_bib0012","series-title":"Proceedings of the ACM International Conference on Multimedia","first-page":"486","article-title":"Q-ground: image quality grounding with large multi-modality models","author":"Chen","year":"2024"},{"key":"10.1016\/j.patcog.2026.113420_bib0013","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"25490","article-title":"Q-instruct: improving low-level visual abilities for multi-modality foundation models","author":"Wu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113420_bib0014","series-title":"European Conference on Computer Vision","first-page":"360","article-title":"Towards open-ended visual quality comparison","author":"Wu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113420_bib0015","series-title":"European Conference on Computer Vision","first-page":"259","article-title":"Depicting beyond scores: advancing image quality assessment through multi-modal language models","author":"You","year":"2024"},{"key":"10.1016\/j.patcog.2026.113420_bib0016","series-title":"Proceedings of the Computer Vision and Pattern Recognition Conference","first-page":"14483","article-title":"Teaching large language models to regress accurate image quality scores using score distribution","author":"You","year":"2025"},{"key":"10.1016\/j.patcog.2026.113420_bib0017","series-title":"International Conference on Machine Learning","first-page":"54015","article-title":"Q-align: teaching lmms for visual scoring via discrete text-defined levels","author":"Wu","year":"2024"},{"issue":"12","key":"10.1016\/j.patcog.2026.113420_bib0018","doi-asserted-by":"crossref","first-page":"4695","DOI":"10.1109\/TIP.2012.2214050","article-title":"No-reference image quality assessment in the spatial domain","volume":"21","author":"Mittal","year":"2012","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113420_bib0019","series-title":"IEEE International Conference on Bioinformatics and Biomedicine","first-page":"3711","article-title":"ADTAH: neuron 3D reconstruction via adaptive distance transformation and adaptive hessian matrix","author":"Song","year":"2024"},{"key":"10.1016\/j.patcog.2026.113420_bib0020","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"5613","article-title":"Multi-view consistent 3D panoptic scene understanding","author":"Liu","year":"2025"},{"key":"10.1016\/j.patcog.2026.113420_bib0021","doi-asserted-by":"crossref","first-page":"9671","DOI":"10.1109\/TMM.2024.3397051","article-title":"Blind image quality assessment based on perceptual comparison","volume":"26","author":"Li","year":"2024","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/j.patcog.2026.113420_bib0022","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"288","article-title":"LVPNet: a latent-variable-based prediction-driven end-to-end framework for lossless compression of medical images","author":"Song","year":"2025"},{"key":"10.1016\/j.patcog.2026.113420_bib0023","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111067","article-title":"Class agnostic and specific consistency learning for weakly-supervised point cloud semantic segmentation","volume":"158","author":"Wu","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113420_bib0024","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"5148","article-title":"MUSIQ: multi-scale image quality transformer","author":"Ke","year":"2021"},{"key":"10.1016\/j.patcog.2026.113420_bib0025","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"402","article-title":"MS-IQA: A multi-scale feature fusion network for PET\/CT image quality assessment","author":"Li","year":"2025"},{"key":"10.1016\/j.patcog.2026.113420_bib0026","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"2555","article-title":"Exploring clip for assessing the look and feel of images","volume":"37","author":"Wang","year":"2023"},{"key":"10.1016\/j.patcog.2026.113420_bib0027","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"1191","article-title":"MANIQA: multi-dimension attention network for no-reference image quality assessment","author":"Yang","year":"2022"},{"issue":"3","key":"10.1016\/j.patcog.2026.113420_bib0028","doi-asserted-by":"crossref","first-page":"105","DOI":"10.1007\/s12559-025-10467-5","article-title":"Revisiting a simple MLP framework for Z-axis rotation-invariant point cloud place recognition","volume":"17","author":"Wu","year":"2025","journal-title":"Cognit. Comput."},{"issue":"10","key":"10.1016\/j.patcog.2026.113420_bib0029","doi-asserted-by":"crossref","first-page":"1159","DOI":"10.1109\/JPROC.2023.3309299","article-title":"Toward label-efficient emotion and sentiment analysis","volume":"111","author":"Zhao","year":"2023","journal-title":"Proc. IEEE"},{"issue":"10","key":"10.1016\/j.patcog.2026.113420_bib0030","doi-asserted-by":"crossref","first-page":"6729","DOI":"10.1109\/TPAMI.2021.3094362","article-title":"Affective image content analysis: two decades review and new perspectives","volume":"44","author":"Zhao","year":"2021","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113420_bib0031","unstructured":"J. Achiam, S. Adler, S. Agarwal, L. Ahmad, I. Akkaya, F.L. Aleman, D. Almeida, J. Altenschmidt, S. Altman, S. Anadkat, et al., GPT-4 technical report(2023). arXiv: 2303.08774."},{"issue":"3","key":"10.1016\/j.patcog.2026.113420_bib0032","doi-asserted-by":"crossref","first-page":"1306","DOI":"10.1007\/s11263-024-02244-y","article-title":"2D semantic-guided semantic scene completion","volume":"133","author":"Liu","year":"2025","journal-title":"Int. J. Comput. Vis."},{"issue":"9","key":"10.1016\/j.patcog.2026.113420_bib0033","doi-asserted-by":"crossref","first-page":"2425","DOI":"10.1007\/s11263-023-01820-y","article-title":"Learning geometric transformation for point cloud completion","volume":"131","author":"Zhang","year":"2023","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.113420_bib0034","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2024.124023","article-title":"Context-based local-global fusion network for 3D point cloud classification and segmentation","volume":"251","author":"Wu","year":"2024","journal-title":"Expert Syst. Appl."},{"issue":"7","key":"10.1016\/j.patcog.2026.113420_bib0035","first-page":"1","article-title":"Quality assessment in the era of large models: a survey","volume":"21","author":"Zhang","year":"2025","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"10.1016\/j.patcog.2026.113420_bib0036","series-title":"IEEE International Conference on Multimedia and Expo","first-page":"1","article-title":"Geometric-aware mapping and uncertainty modeling for semantic scene completion","author":"Liu","year":"2025"},{"key":"10.1016\/j.patcog.2026.113420_bib0037","series-title":"IEEE International Conference on Multimedia and Expo","first-page":"1","article-title":"BPCLIP: a bottom-up image quality assessment from distortion to semantics based on CLIP","author":"Song","year":"2025"},{"key":"10.1016\/j.patcog.2026.113420_bib0038","series-title":"International Conference on Learning Representations","first-page":"12547","article-title":"Q-bench: a benchmark for general-purpose foundation models on low-level vision","volume":"2024","author":"Wu","year":"2024"},{"issue":"12","key":"10.1016\/j.patcog.2026.113420_bib0039","doi-asserted-by":"crossref","first-page":"12873","DOI":"10.1109\/TCSVT.2024.3434999","article-title":"2AFC prompting of large multimodal models for image quality assessment","volume":"34","author":"Zhu","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.patcog.2026.113420_bib0040","unstructured":"Q. Ye, H. Xu, G. Xu, J. Ye, M. Yan, Y. Zhou, J. Wang, A. Hu, P. Shi, Y. Shi, et al., mPLUG-Owl: modularization empowers large language models with multimodality(2023). arXiv: 2304.14178."},{"key":"10.1016\/j.patcog.2026.113420_bib0041","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"770","article-title":"Deep residual learning for image recognition","author":"He","year":"2016"},{"key":"10.1016\/j.patcog.2026.113420_bib0042","series-title":"IEEE International Conference on Image Processing","first-page":"2526","article-title":"Towards unified aesthetics and emotion prediction in images","author":"Yu","year":"2019"},{"key":"10.1016\/j.patcog.2026.113420_bib0043","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"7057","article-title":"Composing photos like a photographer","author":"Hong","year":"2021"},{"key":"10.1016\/j.patcog.2026.113420_bib0044","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"4471","article-title":"Free-form image inpainting with gated convolution","author":"Yu","year":"2019"},{"issue":"11","key":"10.1016\/j.patcog.2026.113420_bib0045","doi-asserted-by":"crossref","first-page":"3440","DOI":"10.1109\/TIP.2006.881959","article-title":"A statistical evaluation of recent full reference image quality assessment algorithms","volume":"15","author":"Sheikh","year":"2006","journal-title":"IEEE Trans. Image Process."},{"issue":"1","key":"10.1016\/j.patcog.2026.113420_bib0046","article-title":"Most apparent distortion: full-reference image quality assessment and the role of strategy","volume":"19","author":"Larson","year":"2010","journal-title":"J. Electron. Imaging"},{"key":"10.1016\/j.patcog.2026.113420_bib0047","series-title":"European Workshop on Visual Information Processing","first-page":"106","article-title":"Color image database TID2013: peculiarities and preliminary results","author":"Ponomarenko","year":"2013"},{"key":"10.1016\/j.patcog.2026.113420_bib0048","series-title":"Eleventh International Conference on Quality of Multimedia Experience","first-page":"1","article-title":"KADID-10k: a large-scale artificially distorted IQA database","author":"Lin","year":"2019"},{"issue":"1","key":"10.1016\/j.patcog.2026.113420_bib0049","doi-asserted-by":"crossref","first-page":"372","DOI":"10.1109\/TIP.2015.2500021","article-title":"Massive online crowdsourced study of subjective and objective picture quality","volume":"25","author":"Ghadiyaram","year":"2015","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113420_bib0050","doi-asserted-by":"crossref","first-page":"4041","DOI":"10.1109\/TIP.2020.2967829","article-title":"KonIQ-10k: an ecologically valid database for deep learning of blind image quality assessment","volume":"29","author":"Hosu","year":"2020","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.113420_bib0051","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"3677","article-title":"Perceptual quality assessment of smartphone photography","author":"Fang","year":"2020"},{"key":"10.1016\/j.patcog.2026.113420_bib0052","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"10012","article-title":"Swin transformer: hierarchical vision transformer using shifted windows","author":"Liu","year":"2021"},{"issue":"8","key":"10.1016\/j.patcog.2026.113420_bib0053","first-page":"9","article-title":"Language models are unsupervised multitask learners","volume":"1","author":"Radford","year":"2019","journal-title":"OpenAI Blog"},{"key":"10.1016\/j.patcog.2026.113420_bib0054","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.patcog.2026.113420_bib0055","first-page":"32611","article-title":"Adaptive image quality assessment via teaching large multimodal model to compare","volume":"37","author":"Zhu","year":"2024","journal-title":"Adv. Neural Inf. Process. Syst."}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326003857?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326003857?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T17:02:29Z","timestamp":1779382949000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326003857"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":55,"alternative-id":["S0031320326003857"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113420","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Affective-aware fine-grained image quality assessment via multi-modal large language models","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113420","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113420"}}