{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,8]],"date-time":"2026-05-08T16:23:55Z","timestamp":1778257435412,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":76,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,10,28]],"date-time":"2024-10-28T00:00:00Z","timestamp":1730073600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,10,28]]},"DOI":"10.1145\/3664647.3680930","type":"proceedings-article","created":{"date-parts":[[2024,10,26]],"date-time":"2024-10-26T06:59:41Z","timestamp":1729925981000},"page":"9989-9998","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":8,"title":["CLiF-VQA: Enhancing Video Quality Assessment by Incorporating High-Level Semantic Information related to Human Feelings"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-2799-3297","authenticated-orcid":false,"given":"Yachun","family":"Mi","sequence":"first","affiliation":[{"name":"Harbin Institute of Technology, harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5544-9425","authenticated-orcid":false,"given":"Yan","family":"Shu","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology, harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-1779-1290","authenticated-orcid":false,"given":"Yu","family":"Li","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology, harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3739-0973","authenticated-orcid":false,"given":"Chen","family":"Hui","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology, harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-0937-6884","authenticated-orcid":false,"given":"Puchao","family":"Zhou","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology, harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1810-5412","authenticated-orcid":false,"given":"Shaohui","family":"Liu","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology, harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2024,10,28]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/TBC.2019.2957670"},{"key":"e_1_3_2_1_2_1","volume-title":"Nature","volume":"411","author":"Bonneh Yoram S","year":"2001","unstructured":"Yoram S Bonneh, Alexander Cooperman, and Dov Sagi. 2001. Motion-induced blindness in normal observers. Nature, Vol. 411, 6839 (2001), 798--801."},{"key":"e_1_3_2_1_3_1","first-page":"1903","article-title":"Learning generalized spatial-temporal deep feature representation for no-reference video quality assessment","volume":"32","author":"Chen Baoliang","year":"2021","unstructured":"Baoliang Chen, Lingyu Zhu, Guo Li, Fangbo Lu, Hongfei Fan, and Shiqi Wang. 2021. Learning generalized spatial-temporal deep feature representation for no-reference video quality assessment. IEEE TCSVT, Vol. 32, 4 (2021), 1903--1916.","journal-title":"IEEE TCSVT"},{"key":"e_1_3_2_1_4_1","volume-title":"Caglar Gulcehre, Dzmitry Bahdanau, Fethi Bougares, Holger Schwenk, and Yoshua Bengio.","author":"Cho Kyunghyun","year":"2014","unstructured":"Kyunghyun Cho, Bart Van Merri\u00ebnboer, Caglar Gulcehre, Dzmitry Bahdanau, Fethi Bougares, Holger Schwenk, and Yoshua Bengio. 2014. Learning phrase representations using RNN encoder-decoder for statistical machine translation. arXiv preprint arXiv:1406.1078 (2014)."},{"key":"e_1_3_2_1_5_1","first-page":"5612","article-title":"No-reference video quality assessment using natural spatiotemporal scene statistics","volume":"29","author":"Reddy Dendi Sathya Veera","year":"2020","unstructured":"Sathya Veera Reddy Dendi and Sumohana S Channappayya. 2020. No-reference video quality assessment using natural spatiotemporal scene statistics. IEEE TIP, Vol. 29 (2020), 5612--5624.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_6_1","volume-title":"Imagenet: A large-scale hierarchical image database","author":"Deng Jia","year":"2009","unstructured":"Jia Deng, Wei Dong, Richard Socher, Li-Jia Li, Kai Li, and Li Fei-Fei. 2009. Imagenet: A large-scale hierarchical image database. In CVPR. IEEE, 248--255."},{"key":"e_1_3_2_1_7_1","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly et al. 2020. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929 (2020)."},{"key":"e_1_3_2_1_8_1","first-page":"8059","article-title":"ChipQA: No-reference video quality prediction via space-time chips","volume":"30","author":"Ebenezer Joshua Peter","year":"2021","unstructured":"Joshua Peter Ebenezer, Zaixi Shang, Yongjun Wu, Hai Wei, Sriram Sethuraman, and Alan C Bovik. 2021. ChipQA: No-reference video quality prediction via space-time chips. IEEE TIP, Vol. 30 (2021), 8059--8074.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3077642"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2017.373"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"crossref","unstructured":"Kensho Hara Hirokatsu Kataoka and Yutaka Satoh. 2018. Can spatiotemporal 3d cnns retrace the history of 2d cnns and imagenet?. In CVPR. 6546--6555.","DOI":"10.1109\/CVPR.2018.00685"},{"key":"e_1_3_2_1_12_1","first-page":"2798","article-title":"Image sharpness assessment based on local phase coherence","volume":"22","author":"Hassen Rania","year":"2013","unstructured":"Rania Hassen, Zhou Wang, and Magdy MA Salama. 2013. Image sharpness assessment based on local phase coherence. IEEE TIP, Vol. 22, 7 (2013), 2798--2810.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_13_1","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep residual learning for image recognition. In CVPR. 770--778."},{"key":"e_1_3_2_1_14_1","volume-title":"Identity mappings in deep residual networks","author":"He Kaiming","unstructured":"Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2016. Identity mappings in deep residual networks. In ECCV. Springer, 630--645."},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Vlad Hosu Bastian Goldlucke and Dietmar Saupe. 2019. Effective aesthetics prediction with multi-level spatially pooled features. In CVPR. 9375--9383.","DOI":"10.1109\/CVPR.2019.00960"},{"key":"e_1_3_2_1_16_1","volume-title":"The Konstanz natural video database (KoNViD-1k)","author":"Hosu Vlad","unstructured":"Vlad Hosu, Franz Hahn, Mohsen Jenadeleh, Hanhe Lin, Hui Men, Tam\u00e1s Szir\u00e1nyi, Shujun Li, and Dietmar Saupe. 2017. The Konstanz natural video database (KoNViD-1k). In QoMEX. IEEE, 1--6."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2024.3389452"},{"key":"e_1_3_2_1_18_1","volume-title":"AesExpert: Towards Multi-modality Foundation Model for Image Aesthetics Perception. arXiv preprint arXiv:2404.09624","author":"Huang Yipo","year":"2024","unstructured":"Yipo Huang, Xiangfei Sheng, Zhichao Yang, Quan Yuan, Zhichao Duan, Pengfei Chen, Leida Li, Weisi Lin, and Guangming Shi. 2024. AesExpert: Towards Multi-modality Foundation Model for Image Aesthetics Perception. arXiv preprint arXiv:2404.09624 (2024)."},{"key":"e_1_3_2_1_19_1","volume-title":"AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception. arXiv preprint arXiv:2401.08276","author":"Huang Yipo","year":"2024","unstructured":"Yipo Huang, Quan Yuan, Xiangfei Sheng, Zhichao Yang, Haoning Wu, Pengfei Chen, Yuzhe Yang, Leida Li, and Weisi Lin. 2024. AesBench: An Expert Benchmark for Multimodal Large Language Models on Image Aesthetics Perception. arXiv preprint arXiv:2401.08276 (2024)."},{"key":"e_1_3_2_1_20_1","volume-title":"Multi-channel adaptive partitioning network for block-based image compressive sensing","author":"Hui Chen","unstructured":"Chen Hui, Shaohui Liu, and Feng Jiang. 2022. Multi-channel adaptive partitioning network for block-based image compressive sensing. In ICME. IEEE, 1--6."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503160"},{"key":"e_1_3_2_1_22_1","volume-title":"Rate-adaptive neural network for image compressive sensing","author":"Hui Chen","year":"2023","unstructured":"Chen Hui, Shengping Zhang, Wenxue Cui, Shaohui Liu, Feng Jiang, and Debin Zhao. 2023. Rate-adaptive neural network for image compressive sensing. IEEE TMM (2023)."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1109\/TBC.2008.2001246"},{"key":"e_1_3_2_1_24_1","unstructured":"Will Kay Joao Carreira Karen Simonyan Brian Zhang Chloe Hillier Sudheendra Vijayanarasimhan Fabio Viola Tim Green Trevor Back Paul Natsev et al. 2017. The kinetics human action video dataset. arXiv preprint arXiv:1705.06950 (2017)."},{"key":"e_1_3_2_1_25_1","first-page":"5923","article-title":"Two-level approach for no-reference consumer video quality assessment","volume":"28","author":"Korhonen Jari","year":"2019","unstructured":"Jari Korhonen. 2019. Two-level approach for no-reference consumer video quality assessment. IEEE TIP, Vol. 28, 12 (2019), 5923--5938.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"crossref","unstructured":"Jari Korhonen Yicheng Su and Junyong You. 2020. Blind natural video quality prediction via statistical temporal features and deep spatial features. In ACM MM. 3311--3319.","DOI":"10.1145\/3394171.3413845"},{"key":"e_1_3_2_1_27_1","first-page":"2957","article-title":"No-reference quality assessment of tone-mapped HDR pictures","volume":"26","author":"Kundu Debarati","year":"2017","unstructured":"Debarati Kundu, Deepti Ghadiyaram, Alan C Bovik, and Brian L Evans. 2017. No-reference quality assessment of tone-mapped HDR pictures. IEEE TIP, Vol. 26, 6 (2017), 2957--2971.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_28_1","first-page":"5944","article-title":"Blindly assess quality of in-the-wild videos via quality-aware pre-training and motion perception","volume":"32","author":"Li Bowen","year":"2022","unstructured":"Bowen Li, Weixia Zhang, Meng Tian, Guangtao Zhai, and Xianpei Wang. 2022. Blindly assess quality of in-the-wild videos via quality-aware pre-training and motion perception. IEEE TCSVT, Vol. 32, 9 (2022), 5944--5958.","journal-title":"IEEE TCSVT"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"crossref","unstructured":"Dingquan Li Tingting Jiang and Ming Jiang. 2019. Quality assessment of in-the-wild videos. In ACM MM. 2351--2359.","DOI":"10.1145\/3343031.3351028"},{"key":"e_1_3_2_1_30_1","first-page":"1221","article-title":"Which has better visual quality: The clear blue sky or a blurry animal","volume":"21","author":"Li Dingquan","year":"2018","unstructured":"Dingquan Li, Tingting Jiang, Weisi Lin, and Ming Jiang. 2018. Which has better visual quality: The clear blue sky or a blurry animal? IEEE TMM, Vol. 21, 5 (2018), 1221--1234.","journal-title":"IEEE TMM"},{"key":"e_1_3_2_1_31_1","first-page":"4798","article-title":"Theme-aware visual attribute reasoning for image aesthetics assessment","volume":"33","author":"Li Leida","year":"2023","unstructured":"Leida Li, Yipo Huang, Jinjian Wu, Yuzhe Yang, Yaqian Li, Yandong Guo, and Guangming Shi. 2023. Theme-aware visual attribute reasoning for image aesthetics assessment. IEEE TCSVT, Vol. 33, 9 (2023), 4798--4811.","journal-title":"IEEE TCSVT"},{"key":"e_1_3_2_1_32_1","volume-title":"UGC-VIDEO: perceptual quality assessment of user-generated videos","author":"Li Yang","unstructured":"Yang Li, Shengbin Meng, Xinfeng Zhang, Shiqi Wang, Yue Wang, and Siwei Ma. 2020. UGC-VIDEO: perceptual quality assessment of user-generated videos. In MIPR. IEEE, 35--38."},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"crossref","unstructured":"Liang Liao Kangmin Xu Haoning Wu Chaofeng Chen Wenxiu Sun Qiong Yan and Weisi Lin. 2022. Exploring the effectiveness of video perceptual representation in blind video quality assessment. In ACM MM. 837--846.","DOI":"10.1145\/3503161.3547849"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"crossref","unstructured":"Wentao Liu Zhengfang Duanmu and Zhou Wang. 2018. End-to-End Blind Quality Assessment of Compressed Videos Using Deep Neural Networks.. In ACM MM. 546--554.","DOI":"10.1145\/3240508.3240643"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"crossref","unstructured":"Ze Liu Yutong Lin Yue Cao Han Hu Yixuan Wei Zheng Zhang Stephen Lin and Baining Guo. 2021. Swin transformer: Hierarchical vision transformer using shifted windows. In ICCV. 10012--10022.","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"crossref","unstructured":"Ze Liu Jia Ning Yue Cao Yixuan Wei Zheng Zhang Stephen Lin and Han Hu. 2022. Video swin transformer. In CVPR. 3202--3211.","DOI":"10.1109\/CVPR52688.2022.00320"},{"key":"e_1_3_2_1_37_1","volume-title":"ZE-FESG: A Zero-Shot Feature Extraction Method Based on Semantic Guidance for No-Reference Video Quality Assessment","author":"Mi Yachun","unstructured":"Yachun Mi, Yu Li, Yan Shu, and Shaohui Liu. 2024. ZE-FESG: A Zero-Shot Feature Extraction Method Based on Semantic Guidance for No-Reference Video Quality Assessment. In ICASSP. IEEE, 3640--3644."},{"key":"e_1_3_2_1_38_1","volume-title":"VVA: Video Values Analysis","author":"Mi Yachun","year":"2023","unstructured":"Yachun Mi, Yan Shu, Honglei Xu, Shaohui Liu, and Feng Jiang. 2023. VVA: Video Values Analysis. In PRCV. Springer, 346--358."},{"key":"e_1_3_2_1_39_1","volume-title":"Evaluating the role of content in subjective video quality assessment. The scientific world journal","author":"Mirkovic Milan","year":"2014","unstructured":"Milan Mirkovic, Petar Vrgovic, Dubravko Culibrk, Darko Stefanovic, and Andras Anderla. 2014. Evaluating the role of content in subjective video quality assessment. The scientific world journal, Vol. 2014, 1 (2014), 625219."},{"key":"e_1_3_2_1_40_1","first-page":"4695","article-title":"No-reference image quality assessment in the spatial domain","volume":"21","author":"Mittal Anish","year":"2012","unstructured":"Anish Mittal, Anush Krishna Moorthy, and Alan Conrad Bovik. 2012. No-reference image quality assessment in the spatial domain. IEEE TIP, Vol. 21, 12 (2012), 4695--4708.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_41_1","first-page":"289","article-title":"A completely blind video integrity oracle","volume":"25","author":"Mittal Anish","year":"2015","unstructured":"Anish Mittal, Michele A Saad, and Alan C Bovik. 2015. A completely blind video integrity oracle. IEEE TIP, Vol. 25, 1 (2015), 289--300.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_42_1","first-page":"209","article-title":"Making a 'completely blind' image quality analyzer","volume":"20","author":"Mittal Anish","year":"2012","unstructured":"Anish Mittal, Rajiv Soundararajan, and Alan C Bovik. 2012. Making a 'completely blind' image quality analyzer. IEEE SPL, Vol. 20, 3 (2012), 209--212.","journal-title":"IEEE SPL"},{"key":"e_1_3_2_1_43_1","volume-title":"CVD2014'A database for evaluating no-reference video quality assessment algorithms. IEEE TIP","volume":"25","author":"Nuutinen Mikko","year":"2016","unstructured":"Mikko Nuutinen, Toni Virtanen, Mikko Vaahteranoksa, Tero Vuori, Pirkko Oittinen, and Jukka H\u00e4kkinen. 2016. CVD2014'A database for evaluating no-reference video quality assessment algorithms. IEEE TIP, Vol. 25, 7 (2016), 3073--3086."},{"key":"e_1_3_2_1_44_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. 2021. Learning transferable visual models from natural language supervision. In ICML. PMLR, 8748--8763."},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1364\/JOSA.56.001141"},{"key":"e_1_3_2_1_46_1","first-page":"1352","article-title":"Blind prediction of natural video quality","volume":"23","author":"Saad Michele A","year":"2014","unstructured":"Michele A Saad, Alan C Bovik, and Christophe Charrier. 2014. Blind prediction of natural video quality. IEEE TIP, Vol. 23, 3 (2014), 1352--1365.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_47_1","volume-title":"Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556","author":"Simonyan Karen","year":"2014","unstructured":"Karen Simonyan and Andrew Zisserman. 2014. Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556 (2014)."},{"key":"e_1_3_2_1_48_1","first-page":"612","article-title":"Large-scale study of perceptual video quality","volume":"28","author":"Sinno Zeina","year":"2018","unstructured":"Zeina Sinno and Alan Conrad Bovik. 2018. Large-scale study of perceptual video quality. IEEE TIP, Vol. 28, 2 (2018), 612--627.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_49_1","doi-asserted-by":"crossref","unstructured":"Wei Sun Xiongkuo Min Wei Lu and Guangtao Zhai. 2022. A deep learning based no-reference quality assessment model for ugc videos. In ACM MM. 856--865.","DOI":"10.1145\/3503161.3548329"},{"key":"e_1_3_2_1_50_1","volume-title":"Efficientnet: Rethinking model scaling for convolutional neural networks. In ICML. PMLR, 6105--6114.","author":"Tan Mingxing","year":"2019","unstructured":"Mingxing Tan and Quoc Le. 2019. Efficientnet: Rethinking model scaling for convolutional neural networks. In ICML. PMLR, 6105--6114."},{"key":"e_1_3_2_1_51_1","unstructured":"Mingxing Tan and Quoc Le. 2021. Efficientnetv2: Smaller models and faster training. In ICML. PMLR 10096--10106."},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"crossref","unstructured":"Du Tran Lubomir Bourdev Rob Fergus Lorenzo Torresani and Manohar Paluri. 2015. Learning spatiotemporal features with 3d convolutional networks. In ICCV. 4489--4497.","DOI":"10.1109\/ICCV.2015.510"},{"key":"e_1_3_2_1_53_1","first-page":"4449","article-title":"UGC-VQA: Benchmarking blind video quality assessment for user generated content","volume":"30","author":"Tu Zhengzhong","year":"2021","unstructured":"Zhengzhong Tu, Yilin Wang, Neil Birkbeck, Balu Adsumilli, and Alan C Bovik. 2021. UGC-VQA: Benchmarking blind video quality assessment for user generated content. IEEE TIP, Vol. 30 (2021), 4449--4464.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_54_1","first-page":"425","article-title":"RAPIQUE: Rapid and accurate video quality prediction of user generated content","volume":"2","author":"Tu Zhengzhong","year":"2021","unstructured":"Zhengzhong Tu, Xiangxu Yu, Yilin Wang, Neil Birkbeck, Balu Adsumilli, and Alan C Bovik. 2021. RAPIQUE: Rapid and accurate video quality prediction of user generated content. IEEE OJSP, Vol. 2 (2021), 425--440.","journal-title":"IEEE OJSP"},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i2.25353"},{"key":"e_1_3_2_1_56_1","volume-title":"YouTube UGC dataset for video compression research","author":"Wang Yilin","unstructured":"Yilin Wang, Sasi Inguva, and Balu Adsumilli. 2019. YouTube UGC dataset for video compression research. In MMSP. IEEE, 1--5."},{"key":"e_1_3_2_1_57_1","volume-title":"Neil Birkbeck, Balu Adsumilli, Peyman Milanfar, and Feng Yang.","author":"Wang Yilin","year":"2021","unstructured":"Yilin Wang, Junjie Ke, Hossein Talebi, Joong Gon Yim, Neil Birkbeck, Balu Adsumilli, Peyman Milanfar, and Feng Yang. 2021. Rich features for perceptual quality assessment of UGC videos. In CVPR. 13435--13444."},{"key":"e_1_3_2_1_58_1","volume-title":"Fast-vqa: Efficient end-to-end video quality assessment with fragment sampling","author":"Wu Haoning","year":"2022","unstructured":"Haoning Wu, Chaofeng Chen, Jingwen Hou, Liang Liao, Annan Wang, Wenxiu Sun, Qiong Yan, and Weisi Lin. 2022. Fast-vqa: Efficient end-to-end video quality assessment with fragment sampling. In ECCV. Springer, 538--554."},{"key":"e_1_3_2_1_59_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3319332"},{"key":"e_1_3_2_1_60_1","volume-title":"Discovqa: Temporal distortion-content transformers for video quality assessment","author":"Wu Haoning","year":"2023","unstructured":"Haoning Wu, Chaofeng Chen, Liang Liao, Jingwen Hou, Wenxiu Sun, Qiong Yan, and Weisi Lin. 2023. Discovqa: Temporal distortion-content transformers for video quality assessment. IEEE TCSVT (2023)."},{"key":"e_1_3_2_1_61_1","doi-asserted-by":"crossref","unstructured":"Haoning Wu Liang Liao Jingwen Hou Chaofeng Chen Erli Zhang Annan Wang Wenxiu Sun Qiong Yan and Weisi Lin. 2023. Exploring Opinion-Unaware Video Quality Assessment with Semantic Affinity Criterion. In ICME. 366--371.","DOI":"10.1109\/ICME55011.2023.00070"},{"key":"e_1_3_2_1_62_1","volume-title":"2023 d. Towards Robust Text-Prompted Semantic Criterion for In-the-Wild Video Quality Assessment. arXiv preprint arXiv:2304.14672","author":"Wu Haoning","year":"2023","unstructured":"Haoning Wu, Liang Liao, Annan Wang, Chaofeng Chen, Jingwen Hou, Wenxiu Sun, Qiong Yan, and Weisi Lin. 2023 d. Towards Robust Text-Prompted Semantic Criterion for In-the-Wild Video Quality Assessment. arXiv preprint arXiv:2304.14672 (2023)."},{"key":"e_1_3_2_1_63_1","unstructured":"Haoning Wu Erli Zhang Liang Liao Chaofeng Chen Jingwen Hou Annan Wang Wenxiu Sun Qiong Yan and Weisi Lin. 2023 e. Exploring video quality assessment on user generated contents from aesthetic and technical perspectives. In ICCV. 20144--20154."},{"key":"e_1_3_2_1_64_1","doi-asserted-by":"crossref","unstructured":"Haoning Wu Erli Zhang Liang Liao Chaofeng Chen Jingwen Hou Annan Wang Wenxiu Sun Qiong Yan and Weisi Lin. 2023 f. Towards Explainable In-the-Wild Video Quality Assessment: A Database and a Language-Prompted Approach. In ACM MM. 1045--1054.","DOI":"10.1145\/3581783.3611737"},{"key":"e_1_3_2_1_65_1","doi-asserted-by":"crossref","unstructured":"Jiahua Xu Jing Li Xingguang Zhou Wei Zhou Baichao Wang and Zhibo Chen. 2021. Perceptual quality assessment of internet videos. In ACM MM. 1248--1257.","DOI":"10.1145\/3474085.3475486"},{"key":"e_1_3_2_1_66_1","volume-title":"No-reference video quality assessment via feature learning","author":"Xu Jingtao","unstructured":"Jingtao Xu, Peng Ye, Yong Liu, and David Doermann. 2014. No-reference video quality assessment via feature learning. In ICIP. IEEE, 491--495."},{"key":"e_1_3_2_1_67_1","first-page":"4850","article-title":"Blind image quality assessment using joint statistics of gradient magnitude and Laplacian features","volume":"23","author":"Xue Wufeng","year":"2014","unstructured":"Wufeng Xue, Xuanqin Mou, Lei Zhang, Alan C Bovik, and Xiangchu Feng. 2014. Blind image quality assessment using joint statistics of gradient magnitude and Laplacian features. IEEE TIP, Vol. 23, 11 (2014), 4850--4862.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_68_1","first-page":"4863","article-title":"Video compressive sensing using Gaussian mixture models","volume":"23","author":"Yang Jianbo","year":"2014","unstructured":"Jianbo Yang, Xin Yuan, Xuejun Liao, Patrick Llull, David J Brady, Guillermo Sapiro, and Lawrence Carin. 2014. Video compressive sensing using Gaussian mixture models. IEEE TIP, Vol. 23, 11 (2014), 4863--4878.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_69_1","volume-title":"Unsupervised feature learning framework for no-reference image quality assessment","author":"Ye Peng","unstructured":"Peng Ye, Jayant Kumar, Le Kang, and David Doermann. 2012. Unsupervised feature learning framework for no-reference image quality assessment. In CVPR. IEEE, 1098--1105."},{"key":"e_1_3_2_1_70_1","doi-asserted-by":"crossref","unstructured":"Zhenqiang Ying Maniratnam Mandal Deepti Ghadiyaram and Alan Bovik. 2021. Patch-VQ:'Patching Up'the video quality problem. In CVPR. 14019--14029.","DOI":"10.1109\/CVPR46437.2021.01380"},{"key":"e_1_3_2_1_71_1","volume-title":"Deep neural networks for no-reference video quality assessment","author":"You Junyong","unstructured":"Junyong You and Jari Korhonen. 2019. Deep neural networks for no-reference video quality assessment. In ICIP. IEEE, 2349--2353."},{"key":"e_1_3_2_1_72_1","volume-title":"Emotion and perception: The role of affective information","author":"Zadra Jonathan R","year":"2011","unstructured":"Jonathan R Zadra and Gerald L Clore. 2011. Emotion and perception: The role of affective information. Wiley interdisciplinary reviews: cognitive science, Vol. 2, 6 (2011), 676--685."},{"key":"e_1_3_2_1_73_1","doi-asserted-by":"crossref","unstructured":"Zicheng Zhang Wei Wu Wei Sun Danyang Tu Wei Lu Xiongkuo Min Ying Chen and Guangtao Zhai. 2023. MD-VQA: Multi-dimensional quality assessment for UGC live videos. In CVPR. 1746--1755.","DOI":"10.1109\/CVPR52729.2023.00174"},{"key":"e_1_3_2_1_74_1","first-page":"1182","article-title":"Video compressive sensing reconstruction via reweighted residual sparsity","volume":"27","author":"Zhao Chen","year":"2016","unstructured":"Chen Zhao, Siwei Ma, Jian Zhang, Ruiqin Xiong, and Wen Gao. 2016. Video compressive sensing reconstruction via reweighted residual sparsity. IEEE TCSVT, Vol. 27, 6 (2016), 1182--1195.","journal-title":"IEEE TCSVT"},{"key":"e_1_3_2_1_75_1","doi-asserted-by":"crossref","unstructured":"Kai Zhao Kun Yuan Ming Sun and Xing Wen. 2023. Zoom-VQA: Patches Frames and Clips Integration for Video Quality Assessment. In CVPR. 1302--1310.","DOI":"10.1109\/CVPRW59228.2023.00137"},{"key":"e_1_3_2_1_76_1","first-page":"1031","article-title":"Learning Spatiotemporal Interactions for User-Generated Video Quality Assessment","volume":"33","author":"Zhu Hanwei","year":"2022","unstructured":"Hanwei Zhu, Baoliang Chen, Lingyu Zhu, and Shiqi Wang. 2022. Learning Spatiotemporal Interactions for User-Generated Video Quality Assessment. IEEE TCSVT, Vol. 33, 3 (2022), 1031--1042.","journal-title":"IEEE TCSVT"}],"event":{"name":"MM '24: The 32nd ACM International Conference on Multimedia","location":"Melbourne VIC Australia","acronym":"MM '24","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 32nd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3680930","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3664647.3680930","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:17:34Z","timestamp":1750295854000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3680930"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,28]]},"references-count":76,"alternative-id":["10.1145\/3664647.3680930","10.1145\/3664647"],"URL":"https:\/\/doi.org\/10.1145\/3664647.3680930","relation":{},"subject":[],"published":{"date-parts":[[2024,10,28]]},"assertion":[{"value":"2024-10-28","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}