{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T04:32:01Z","timestamp":1774413121142,"version":"3.50.1"},"reference-count":78,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"1","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2026,1]]},"DOI":"10.1109\/tpami.2025.3604091","type":"journal-article","created":{"date-parts":[[2025,8,29]],"date-time":"2025-08-29T17:42:14Z","timestamp":1756489334000},"page":"329-345","source":"Crossref","is-referenced-by-count":2,"title":["Spherical Vision Transformers for Audio-Visual Saliency Prediction in 360$^{\\circ }$\u2218 Videos"],"prefix":"10.1109","volume":"48","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-0577-8908","authenticated-orcid":false,"given":"Mert","family":"Cokelek","sequence":"first","affiliation":[{"name":"Department of Computer Science and Engineering, Ko&#x00E7; University, Istanbul, T&#x00FC;rkiye"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8529-026X","authenticated-orcid":false,"given":"Halit","family":"Ozsoy","sequence":"additional","affiliation":[{"name":"Department of Psychology, Bo&#x011F;azi&#x00E7;i University, Istanbul, T&#x00FC;rkiye"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2661-599X","authenticated-orcid":false,"given":"Nevrez","family":"Imamoglu","sequence":"additional","affiliation":[{"name":"National Institute of Advanced Industrial Science and Technology (AIST), Intelligent Platforms Research Institute, Tokyo 135-0064, Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4915-2251","authenticated-orcid":false,"given":"Cagri","family":"Ozcinar","sequence":"additional","affiliation":[{"name":"MSK.AI, London, U.K."}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Inci","family":"Ayhan","sequence":"additional","affiliation":[{"name":"Department of Psychology, Bo&#x011F;azi&#x00E7;i University, Istanbul, T&#x00FC;rkiye"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6744-8614","authenticated-orcid":false,"given":"Erkut","family":"Erdem","sequence":"additional","affiliation":[{"name":"Department of Computer Engineering, Hacettepe University, Ankara, T&#x00FC;rkiye"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6280-8422","authenticated-orcid":false,"given":"Aykut","family":"Erdem","sequence":"additional","affiliation":[{"name":"Department of Computer Science and Engineering, Ko&#x00E7; University, Istanbul, T&#x00FC;rkiye"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2017.2721544"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2021.07.012"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2019.2911396"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2017.08.054"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/WACV51458.2022.00355"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2017.2703148"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350990"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW54120.2021.00222"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1016\/j.ijleo.2021.166858"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10096750"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/2980179.2980246"},{"key":"ref12","first-page":"1","article-title":"Spherical vision transformer for 360-degree video saliency prediction","volume-title":"Proc. Brit. Mach. Vis. Conf.","author":"Cokelek","year":"2023"},{"key":"ref13","article-title":"An image is worth 16 x 16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01244"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00482"},{"key":"ref16","article-title":"Dave: A deep audio-visual embedding for dynamic saliency prediction","author":"Tavakoli","year":"2019"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2020.2966082"},{"key":"ref18","first-page":"16664","article-title":"Adaptformer: Adapting vision transformers for scalable visual recognition","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Chen","year":"2022"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICMEW.2018.8551543"},{"key":"ref20","article-title":"SalGAN: Visual saliency prediction with generative adversarial networks","author":"Pan","year":"2017"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.3003642"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1145\/3204949.3208139"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2858783"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350947"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00559"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3306596"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1145\/3565267"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICMEW46912.2020.9105956"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2025.3567842"},{"key":"ref30","first-page":"305","article-title":"ATSal: An attention based architecture for saliency prediction in 360 videos","volume-title":"Proc. Int. Conf. Pattern Recognit.","author":"Dahou"},{"key":"ref31","first-page":"488","article-title":"Saliency detection in 360-degree videos","volume-title":"Proc. Eur. Conf. Comput. Vis.","author":"Zhang","year":"2018"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.01513"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1016\/j.image.2018.05.010"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2019.2957986"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1145\/3410455"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00154"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.2987682"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3126590"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19833-5_25"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2102.05095"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/VCIP.2015.7457921"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2020.12.011"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1145\/3576857"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/TETCI.2024.3358184"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02575"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/VCIP49819.2020.9301766"},{"key":"ref47","first-page":"1","article-title":"Leveraging frequency based salient spatial sound localization to improve 360 video saliency prediction","volume-title":"Proc. Mach. Vis. Appl.","author":"Cokelek","year":"2021"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3271022"},{"key":"ref49","first-page":"4733","article-title":"Learning representations from audio-visual spatial alignment","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Morgado","year":"2020"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1167\/16.2.3"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1167\/8.14.6"},{"key":"ref52","article-title":"Audio-visual saliency in omnidirectional panoramic scenes","author":"Ozsoy","year":"2024"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053174"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2723009"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.3758\/brm.41.4.1149"},{"issue":"146","key":"ref57","first-page":"10","article-title":"Converting video formats with FFmpeg","volume":"2006","author":"Tomar","year":"2006","journal-title":"Linux J."},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1145\/3314111.3319829"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1145\/3588015.3588406"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.16910\/jemr.15.3.3"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.3758\/app.71.4.881"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1145\/355017.355028"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00282"},{"key":"ref64","article-title":"Spatial transformations for the alteration of ambisonic recordings","author":"Kronlachner","year":"2014"},{"key":"ref65","first-page":"1","article-title":"Self-supervised generation of spatial audio for 360 video","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"31","author":"Morgado","year":"2018"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2022-227"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19836-6_13"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2022.104395"},{"key":"ref69","article-title":"Decoupled weight decay regularization","author":"Loshchilov","year":"2017"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00675"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2023.3251695"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-99-9119-8_46"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2020.2988148"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1145\/3183794"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-020-10050-0"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/VCIP49819.2020.9301766"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240581"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2017.2720693"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/34\/11275622\/11144923.pdf?arnumber=11144923","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,4]],"date-time":"2025-12-04T07:54:28Z","timestamp":1764834868000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11144923\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,1]]},"references-count":78,"journal-issue":{"issue":"1"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2025.3604091","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,1]]}}}