{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,18]],"date-time":"2026-07-18T03:41:16Z","timestamp":1784346076705,"version":"3.55.0"},"reference-count":69,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"5","license":[{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62471328"],"award-info":[{"award-number":["62471328"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62531014"],"award-info":[{"award-number":["62531014"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62271276"],"award-info":[{"award-number":["62271276"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62276180"],"award-info":[{"award-number":["62276180"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"Zhejiang Natural Science Foundation of China","doi-asserted-by":"publisher","award":["LZ26F020014"],"award-info":[{"award-number":["LZ26F020014"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"National College Student Innovation and Entrepreneurship Development Program","award":["2024103500045"],"award-info":[{"award-number":["2024103500045"]}]},{"name":"Zhejiang Province College Students\u2019 Scientific and Technological Innovation Project","award":["2024R435A004"],"award-info":[{"award-number":["2024R435A004"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Circuits Syst. Video Technol."],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1109\/tcsvt.2026.3652641","type":"journal-article","created":{"date-parts":[[2026,1,12]],"date-time":"2026-01-12T22:04:02Z","timestamp":1768255442000},"page":"6783-6798","source":"Crossref","is-referenced-by-count":7,"title":["Multi-Modal Cross-Attention-Guided Network for Audio-Visual Quality Evaluation via Visual Saliency and Mel-Spectrum Features"],"prefix":"10.1109","volume":"36","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-8727-8790","authenticated-orcid":false,"given":"Junhao","family":"Lin","sequence":"first","affiliation":[{"name":"Institute of Intelligent Information Processing, Taizhou University, Taizhou, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9837-6705","authenticated-orcid":false,"given":"Yueli","family":"Cui","sequence":"additional","affiliation":[{"name":"Institute of Intelligent Information Processing, Taizhou University, Taizhou, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-6143-490X","authenticated-orcid":false,"given":"Chenli","family":"Fang","sequence":"additional","affiliation":[{"name":"Institute of Intelligent Information Processing, Taizhou University, Taizhou, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-1734-1058","authenticated-orcid":false,"given":"Binghong","family":"Pan","sequence":"additional","affiliation":[{"name":"Institute of Intelligent Information Processing, Taizhou University, Taizhou, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-5237-0088","authenticated-orcid":false,"given":"Chencheng","family":"Pan","sequence":"additional","affiliation":[{"name":"Department of Computer Science, USC Viterbi School of Engineering, University of Southern California, Los Angeles, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4896-9876","authenticated-orcid":false,"given":"Gangyi","family":"Jiang","sequence":"additional","affiliation":[{"name":"Faculty of Information Science and Engineering, Ningbo University, Ningbo, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8184-5088","authenticated-orcid":false,"given":"Shiqing","family":"Zhang","sequence":"additional","affiliation":[{"name":"Institute of Intelligent Information Processing, Taizhou University, Taizhou, Zhejiang, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2731-5403","authenticated-orcid":false,"given":"Siwei","family":"Ma","sequence":"additional","affiliation":[{"name":"National Engineering Research Center of Visual Technology, School of Computer Science, Peking University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7252-5047","authenticated-orcid":false,"given":"Qi","family":"Tian","sequence":"additional","affiliation":[{"name":"Huawei Cloud and AI, Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TMC.2024.3461685"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3469180"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3330096"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1145\/3414837"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TIM.2023.3306527"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TIM.2024.3481532"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TIM.2022.3205928"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2025.3585993"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2025.3540104"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3450085"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2025.3571788"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TASLPRO.2025.3552925"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2024.3478211"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2024.3477291"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1117\/1.JEI.23.6.061108"},{"key":"ref16","first-page":"2125","article-title":"A no-reference audio-visual video quality metric","volume-title":"Proc. 22nd Eur. Signal Process. Conf. (EUSIPCO)","author":"Martinez"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-020-09047-6"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2006.879871"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/cvprw56347.2022.00278"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2023.3251695"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2024.3522855"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2020.2988148"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-99-9119-8_46"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01392"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2003.819861"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2012.2214050"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1016\/j.dsp.2021.103138"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/s00530-024-01404-x"},{"key":"ref29","first-page":"3","article-title":"PEAQ-The ITU standard for objective measurement of perceived audio quality","volume":"48","author":"Thiede","year":"2000","journal-title":"J. Audio Eng. Soc."},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.883259"},{"issue":"12","key":"ref31","first-page":"963","article-title":"A perceptual audio quality measure based on a psychoacoustic sound representation","volume":"40","author":"Beerends","year":"1992","journal-title":"J. Audio Eng. Soc."},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.883177"},{"key":"ref33","first-page":"645","article-title":"Blind assessment of audio quality using Gaussian mixture models","volume":"15","author":"Wang","year":"2008","journal-title":"IEEE Signal Process. Lett."},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/TASLPRO.2025.3536156"},{"issue":"10","key":"ref35","first-page":"1544","article-title":"End-to-end blind audio quality assessment using deep convolutional neural networks","volume":"27","author":"Choi","year":"2019","journal-title":"IEEE\/ACM Trans. Audio, Speech, Language Process."},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1121\/1.4921674"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/YSF.2017.8126592"},{"key":"ref38","first-page":"21","article-title":"PERCEVAL: Perceptual evaluation of the quality of audio signals","volume":"40","author":"Paillard","year":"1992","journal-title":"J. Audio Eng. Soc."},{"key":"ref39","first-page":"535","article-title":"Perceptual objective quality evaluation method for high-quality multichannel audio codecs","volume":"61","author":"Seo","year":"2013","journal-title":"J. Audio Eng. Soc."},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TBC.2015.2424373"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.3758\/s13414-015-0990-6"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1145\/1961189.1961199"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-018-5656-7"},{"key":"ref44","volume-title":"Parametric Bitstream-based Quality Assessment of Progressive Download and Adaptive Audiovisual Streaming Services Over Reliable Transport","year":"2017"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3057230"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2017.2764438"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01939"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02492"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2017.2750918"},{"key":"ref50","first-page":"1","article-title":"Cross-attentional audiovisual fusion for weakly-supervised action localization","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Lee"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2012.2189562"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/FG59268.2024.10582018"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2015.2413944"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.243"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00474"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2021-698"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP49359.2023.10222476"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1016\/B978-0-08-050753-8.50042-5"},{"key":"ref61","volume-title":"Final Report From the Video Quality Experts Group on the Validation of Objective Models of Video Quality Assessment","year":"2015"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.5555\/2188385.2188395"},{"key":"ref63","article-title":"Content-rich AIGC video quality assessment via intricate text alignment and motion-aware consistency","author":"Sun","year":"2025","journal-title":"arXiv:2502.04076"},{"key":"ref64","article-title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound","author":"Tjandra","year":"2025","journal-title":"arXiv:2502.05139"},{"key":"ref65","article-title":"Very deep convolutional networks for large-scale image recognition","author":"Simonyan","year":"2014","journal-title":"arXiv:1409.1556"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2006.881959"},{"key":"ref67","first-page":"12449","article-title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst. (NIPS)","author":"Baevski"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2017.7966039"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3351028"}],"container-title":["IEEE Transactions on Circuits and Systems for Video Technology"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/76\/11511351\/11345165.pdf?arnumber=11345165","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,7]],"date-time":"2026-05-07T19:56:35Z","timestamp":1778183795000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11345165\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5]]},"references-count":69,"journal-issue":{"issue":"5"},"URL":"https:\/\/doi.org\/10.1109\/tcsvt.2026.3652641","relation":{},"ISSN":["1051-8215","1558-2205"],"issn-type":[{"value":"1051-8215","type":"print"},{"value":"1558-2205","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,5]]}}}