{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,5,24]],"date-time":"2025-05-24T04:03:41Z","timestamp":1748059421965,"version":"3.41.0"},"publisher-location":"Cham","reference-count":45,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031918551","type":"print"},{"value":"9783031918568","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-91856-8_8","type":"book-chapter","created":{"date-parts":[[2025,5,23]],"date-time":"2025-05-23T11:16:09Z","timestamp":1747998969000},"page":"127-143","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["AVSal: Enhancing Video Saliency Prediction Through Audio-Visual Fusion and\u00a0Temporal Aggregation"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-0542-578X","authenticated-orcid":false,"given":"Yuxin","family":"Zhu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-3054-4268","authenticated-orcid":false,"given":"Yinan","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6519-4067","authenticated-orcid":false,"given":"Huiyu","family":"Duan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5087-6559","authenticated-orcid":false,"given":"Yuqin","family":"Cao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-2623-4756","authenticated-orcid":false,"given":"Ziheng","family":"Jia","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4645-9776","authenticated-orcid":false,"given":"Qiang","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5693-0416","authenticated-orcid":false,"given":"Xiongkuo","family":"Min","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8165-9322","authenticated-orcid":false,"given":"Guangtao","family":"Zhai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,5,12]]},"reference":[{"issue":"2","key":"8_CR1","doi-asserted-by":"publisher","first-page":"679","DOI":"10.1109\/TPAMI.2019.2935715","volume":"43","author":"A Borji","year":"2021","unstructured":"Borji, A.: Saliency prediction in the deep learning era: Successes and limitations. IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI) 43(2), 679\u2013700 (2021)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"issue":"1","key":"8_CR2","doi-asserted-by":"publisher","first-page":"55","DOI":"10.1109\/TIP.2012.2210727","volume":"22","author":"A Borji","year":"2013","unstructured":"Borji, A., Sihite, D.N., Itti, L.: Quantitative analysis of human-model agreement in visual saliency modeling: a comparative study. IEEE Trans. Image Process. (TIP) 22(1), 55\u201369 (2013)","journal-title":"IEEE Trans. Image Process. (TIP)"},{"key":"8_CR3","unstructured":"Bruce, N.D.B., Tsotsos, J.K.: Saliency based on information maximization. In: Proceedings of the International Conference on Neural Information Processing Systems (NeurIPS), pp. 155\u2013162. MIT Press, Cambridge, MA, USA (2005)"},{"key":"8_CR4","doi-asserted-by":"crossref","unstructured":"Cho, K., et al.: Learning phrase representations using RNN encoder\u2013decoder for statistical machine translation. In: Proceedings of the Conference on Empirical Methods in Natural Language Processing (EMNLP), pp. 1724\u20131734 (2014)","DOI":"10.3115\/v1\/D14-1179"},{"issue":"10","key":"8_CR5","doi-asserted-by":"publisher","first-page":"5142","DOI":"10.1109\/TIP.2018.2851672","volume":"27","author":"M Cornia","year":"2018","unstructured":"Cornia, M., Baraldi, L., Serra, G., Cucchiara, R.: Predicting human eye fixations via an LSTM-based saliency attentive model. IEEE Trans. Image Process. (TIP) 27(10), 5142\u20135154 (2018)","journal-title":"IEEE Trans. Image Process. (TIP)"},{"issue":"8","key":"8_CR6","doi-asserted-by":"publisher","first-page":"5","DOI":"10.1167\/14.8.5","volume":"14","author":"A Coutrot","year":"2014","unstructured":"Coutrot, A., Guyader, N.: How saliency, faces, and sound influence gaze in dynamic social scenes. J. Vis. 14(8), 5\u20135 (2014)","journal-title":"J. Vis."},{"key":"8_CR7","doi-asserted-by":"crossref","unstructured":"Coutrot, A., Guyader, N.: Multimodal saliency models for videos. In: From Human Attention to Computational Attention, pp. 291\u2013304. Springer (2016)","DOI":"10.1007\/978-1-4939-3435-5_16"},{"key":"8_CR8","doi-asserted-by":"publisher","first-page":"89","DOI":"10.1007\/s12243-012-0352-5","volume":"69","author":"A Coutrot","year":"2014","unstructured":"Coutrot, A., Guyader, N., Ionescu, G., Caplier, A.: Video viewing: do auditory salient events capture visual attention? Ann. Telecommun. annales Des t\u00e9l\u00e9communications 69, 89\u201397 (2014)","journal-title":"Ann. Telecommun. annales Des t\u00e9l\u00e9communications"},{"key":"8_CR9","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"419","DOI":"10.1007\/978-3-030-58558-7_25","volume-title":"Computer Vision \u2013 ECCV 2020","author":"R Droste","year":"2020","unstructured":"Droste, R., Jiao, J., Noble, J.A.: Unified image and video saliency modeling. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12350, pp. 419\u2013435. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58558-7_25"},{"key":"8_CR10","doi-asserted-by":"crossref","unstructured":"Erdem, E., Erdem, A.: Visual saliency estimation by nonlinearly integrating features using region covariances. J. Vision 13(4), 11\u201311 (03 2013)","DOI":"10.1167\/13.4.11"},{"key":"8_CR11","doi-asserted-by":"crossref","unstructured":"Evangelopoulos, G., et al.: Video event detection and summarization using audio, visual and text saliency. In: Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 3553\u20133556 (2009)","DOI":"10.1109\/ICASSP.2009.4960393"},{"key":"8_CR12","doi-asserted-by":"crossref","unstructured":"Girdhar, R., et al.: Imagebind: One embedding space to bind them all. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2023)","DOI":"10.1109\/CVPR52729.2023.01457"},{"key":"8_CR13","unstructured":"Guo, C., Ma, Q., Zhang, L.: Spatio-temporal saliency detection using phase spectrum of quaternion fourier transform. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.\u00a01\u20138. IEEE (2008)"},{"key":"8_CR14","doi-asserted-by":"crossref","unstructured":"Gygli, M., Grabner, H., Riemenschneider, H., Gool, L.V.: Creating summaries from user videos. In: Proceedings of the European Conference on Computer Vision (ECCV) (2014)","DOI":"10.1007\/978-3-319-10584-0_33"},{"issue":"2","key":"8_CR15","doi-asserted-by":"publisher","first-page":"898","DOI":"10.1109\/TIP.2011.2165292","volume":"21","author":"H Hadizadeh","year":"2012","unstructured":"Hadizadeh, H., Enriquez, M.J., Bajic, I.V.: Eye-tracking database for a set of standard video sequences. IEEE Trans. Image Process. (TIP) 21(2), 898\u2013903 (2012)","journal-title":"IEEE Trans. Image Process. (TIP)"},{"key":"8_CR16","doi-asserted-by":"crossref","unstructured":"Harel, J., Koch, C., Perona, P.: Graph-based visual saliency. In: Proceedings of the International Conference on Neural Information Processing Systems (NeurIPS), pp. 545\u2013552 (2006)","DOI":"10.7551\/mitpress\/7503.003.0073"},{"key":"8_CR17","doi-asserted-by":"crossref","unstructured":"Hou, X., Zhang, L.: Saliency detection: a spectral residual approach. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp.\u00a01\u20138 (2007)","DOI":"10.1109\/CVPR.2007.383267"},{"key":"8_CR18","doi-asserted-by":"crossref","unstructured":"Huang, X., Shen, C., Boix, X., Zhao, Q.: Salicon: Reducing the semantic gap in saliency prediction by adapting deep neural networks. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV), pp. 262\u2013270 (2015)","DOI":"10.1109\/ICCV.2015.38"},{"issue":"11","key":"8_CR19","doi-asserted-by":"publisher","first-page":"1254","DOI":"10.1109\/34.730558","volume":"20","author":"L Itti","year":"1998","unstructured":"Itti, L., Koch, C., Niebur, E.: A model of saliency-based visual attention for rapid scene analysis. IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI) 20(11), 1254\u20131259 (1998)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"8_CR20","doi-asserted-by":"crossref","unstructured":"Jain, S., Yarlagadda, P., Jyoti, S., Karthik, S., Subramanian, R., Gandhi, V.: Vinet: pushing the limits of visual modality for audio-visual saliency prediction. In: Proceedings of the IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS), pp. 3520\u20133527 (2021)","DOI":"10.1109\/IROS51168.2021.9635989"},{"key":"8_CR21","doi-asserted-by":"crossref","unstructured":"Jiang, L., Xu, M., Liu, T., Qiao, M., Wang, Z.: Deepvs: a deep learning based video saliency prediction approach. In: Proceedings of the European Conference on Computer Vision (ECCV) (2018)","DOI":"10.1007\/978-3-030-01264-9_37"},{"key":"8_CR22","doi-asserted-by":"crossref","unstructured":"Judd, T., Ehinger, K., Durand, F., Torralba, A.: Learning to predict where humans look. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV), pp. 2106\u20132113 (2009)","DOI":"10.1109\/ICCV.2009.5459462"},{"key":"8_CR23","first-page":"15","volume":"38","author":"P Koutras","year":"2015","unstructured":"Koutras, P., Maragos, P.: A perceptually based spatio-temporal computational framework for visual saliency estimation. Signal Process.: Image Commun. 38, 15\u201331 (2015)","journal-title":"Signal Process.: Image Commun."},{"issue":"4","key":"8_CR24","doi-asserted-by":"publisher","first-page":"996","DOI":"10.1109\/TPAMI.2012.147","volume":"35","author":"J Li","year":"2013","unstructured":"Li, J., Levine, M.D., An, X., Xu, X., He, H.: Visual saliency based on scale-space analysis in the frequency domain. IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI) 35(4), 996\u20131010 (2013)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"8_CR25","unstructured":"Linardos, P., Mohedano, E., Nieto, J.J., O\u2019Connor, N.E., Gir\u00f3-i-Nieto, X., McGuinness, K.: Simple vs complex temporal recurrences for video saliency prediction. In: Proceedings of the British Machine Vision Conference (BMVC), p.\u00a0182 (2019)"},{"issue":"7","key":"8_CR26","doi-asserted-by":"publisher","first-page":"1408","DOI":"10.1109\/TPAMI.2014.2366154","volume":"37","author":"S Mathe","year":"2015","unstructured":"Mathe, S., Sminchisescu, C.: Actions in the eye: dynamic gaze datasets and learnt saliency models for visual recognition. IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI) 37(7), 1408\u20131424 (2015)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"8_CR27","doi-asserted-by":"crossref","unstructured":"Min, K., Corso, J.J.: Tased-net: Temporally-aggregating spatial encoder-decoder network for video saliency detection. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 2394\u20132403 (2019)","DOI":"10.1109\/ICCV.2019.00248"},{"key":"8_CR28","doi-asserted-by":"crossref","unstructured":"Min, X., Zhai, G., Hu, C., Gu, K.: Fixation prediction through multimodal analysis. In: Proceedings of the IEEE Visual Communications and Image Processing (VCIP), pp.\u00a01\u20134 (2015)","DOI":"10.1109\/VCIP.2015.7457921"},{"key":"8_CR29","doi-asserted-by":"publisher","first-page":"3805","DOI":"10.1109\/TIP.2020.2966082","volume":"29","author":"X Min","year":"2020","unstructured":"Min, X., Zhai, G., Zhou, J., Zhang, X.P., Yang, X., Guan, X.: A multimodal saliency model for videos with high audio-visual correspondence. IEEE Trans. Image Process. (TIP) 29, 3805\u20133819 (2020)","journal-title":"IEEE Trans. Image Process. (TIP)"},{"key":"8_CR30","doi-asserted-by":"publisher","first-page":"5","DOI":"10.1007\/s12559-010-9074-z","volume":"3","author":"PK Mital","year":"2011","unstructured":"Mital, P.K., Smith, T.J., Hill, R.L., Henderson, J.M.: Clustering of gaze during dynamic scene viewing is predicted by motion. Cogn. Comput. 3, 5\u201324 (2011)","journal-title":"Cogn. Comput."},{"key":"8_CR31","unstructured":"Moskalenko, A., Bryntsev, A., Vatolin, D.S., Timofte, R., et\u00a0al.: AIM 2024 challenge on video saliency prediction: Methods and results. In: Proceedings of the European Conference on Computer Vision (ECCV) Workshops (2024)"},{"key":"8_CR32","doi-asserted-by":"crossref","unstructured":"Murray, N., Vanrell, M., Otazu, X., Parraga, C.A.: Saliency estimation using a non-parametric low-level vision model. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 433\u2013440 (2011)","DOI":"10.1109\/CVPR.2011.5995506"},{"key":"8_CR33","unstructured":"Pan, J., et al.: Salgan: Visual saliency prediction with generative adversarial networks (2018). https:\/\/arxiv.org\/abs\/1701.01081"},{"key":"8_CR34","unstructured":"Radford, A., et al.: Learning transferable visual models from natural language supervision. In: Proceedings of the International Conference on Machine Learning (ICML) (2021)"},{"key":"8_CR35","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image synthesis with latent diffusion models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 10674\u201310685 (2022)","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"8_CR36","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., Brox, T.: U-net: Convolutional networks for biomedical image segmentation. In: Proceedings of the Medical Image Computing and Computer-Assisted Intervention (MICCAI), pp. 234\u2013241 (2015)","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"8_CR37","unstructured":"Tavakoli, H.R., Borji, A., Rahtu, E., Kannala, J.: Dave: A deep audio-visual embedding for dynamic saliency prediction (2020). https:\/\/arxiv.org\/abs\/1905.10693"},{"key":"8_CR38","doi-asserted-by":"crossref","unstructured":"Tsiami, A., Koutras, P., Maragos, P.: Stavis: Spatio-temporal audiovisual saliency network. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4766\u20134776 (2020)","DOI":"10.1109\/CVPR42600.2020.00482"},{"issue":"1","key":"8_CR39","doi-asserted-by":"publisher","first-page":"220","DOI":"10.1109\/TPAMI.2019.2924417","volume":"43","author":"W Wang","year":"2021","unstructured":"Wang, W., Shen, J., Xie, J., Cheng, M.M., Ling, H., Borji, A.: Revisiting video saliency prediction in the deep learning era. IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI) 43(1), 220\u2013237 (2021)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"8_CR40","doi-asserted-by":"crossref","unstructured":"Xiong, J., Wang, G., Zhang, P., Huang, W., Zha, Y., Zhai, G.: Casp-net: Rethinking video saliency prediction from an audio-visual consistency perceptual perspective. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6441\u20136450 (2023)","DOI":"10.1109\/CVPR52729.2023.00623"},{"issue":"8","key":"8_CR41","doi-asserted-by":"publisher","first-page":"2163","DOI":"10.1109\/TMM.2019.2947352","volume":"22","author":"S Yang","year":"2020","unstructured":"Yang, S., Lin, G., Jiang, Q., Lin, W.: A dilated inception network for visual saliency prediction. IEEE Trans. Multimedia (TMM) 22(8), 2163\u20132176 (2020)","journal-title":"IEEE Trans. Multimedia (TMM)"},{"key":"8_CR42","doi-asserted-by":"crossref","unstructured":"Zhang, J., Sclaroff, S.: Saliency detection: a Boolean map approach. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV), pp. 153\u2013160 (2013)","DOI":"10.1109\/ICCV.2013.26"},{"issue":"6","key":"8_CR43","doi-asserted-by":"publisher","first-page":"1266","DOI":"10.1109\/TNNLS.2015.2461603","volume":"27","author":"W Zhang","year":"2015","unstructured":"Zhang, W., Borji, A., Wang, Z., Le Callet, P., Liu, H.: The application of visual saliency models in objective image quality assessment: a statistical evaluation. IEEE Transa. Neural Netw. Learn. Syst. (TNNLS) 27(6), 1266\u20131278 (2015)","journal-title":"IEEE Transa. Neural Netw. Learn. Syst. (TNNLS)"},{"issue":"12","key":"8_CR44","doi-asserted-by":"publisher","first-page":"7696","DOI":"10.1109\/TCSVT.2023.3278410","volume":"33","author":"X Zhou","year":"2023","unstructured":"Zhou, X., et al.: Transformer-based multi-scale feature integration network for video saliency prediction. IEEE Trans. Circ. Syst. Video Technol. (TCSVT) 33(12), 7696\u20137707 (2023)","journal-title":"IEEE Trans. Circ. Syst. Video Technol. (TCSVT)"},{"key":"8_CR45","doi-asserted-by":"crossref","unstructured":"Zhu, D., Shao, X., Zhou, Q., Min, X., Zhai, G., Yang, X.: A novel lightweight audio-visual saliency model for videos. ACM Trans. Multimed. Comput. Commun. Appl. (TOMM) 19(4) (2023)","DOI":"10.1145\/3576857"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024 Workshops"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-91856-8_8","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,23]],"date-time":"2025-05-23T11:16:20Z","timestamp":1747998980000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-91856-8_8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9783031918551","9783031918568"],"references-count":45,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-91856-8_8","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"12 May 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}