{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:39:23Z","timestamp":1740123563973,"version":"3.37.3"},"reference-count":105,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2023,10,18]],"date-time":"2023-10-18T00:00:00Z","timestamp":1697587200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2023,10,18]],"date-time":"2023-10-18T00:00:00Z","timestamp":1697587200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"name":"Swansea Science DTC Postgraduate Research Scholarship"},{"DOI":"10.13039\/501100000266","name":"Engineering and Physical Sciences Research Council","doi-asserted-by":"publisher","award":["EP\/T028572\/1"],"award-info":[{"award-number":["EP\/T028572\/1"]}],"id":[{"id":"10.13039\/501100000266","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000288","name":"Royal Society","doi-asserted-by":"publisher","award":["IEC\/NSFC\/ 211159"],"award-info":[{"award-number":["IEC\/NSFC\/ 211159"]}],"id":[{"id":"10.13039\/501100000288","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Research Grants Council of Hong Kong","award":["11205620"],"award-info":[{"award-number":["11205620"]}]},{"name":"Strategic Research Grant from City University of Hong Kong","award":["7005674"],"award-info":[{"award-number":["7005674"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2024,3]]},"abstract":"<jats:title>Abstract<\/jats:title><jats:p>The human visual system has limited capacity in simultaneously processing multiple visual inputs. Consequently, humans rely on shifting their attention from one location to another. When viewing an image of complex scenes, psychology studies and behavioural observations show that humans prioritise and sequentially shift attention among multiple visual stimuli. In this paper, we propose to predict the saliency rank of multiple objects by inferring human attention shift. We first construct a new large-scale salient object ranking dataset, with the saliency rank of objects defined by the order that an observer attends to these objects via attention shift. We then propose a new deep learning-based model to leverage both bottom-up and top-down attention mechanisms for saliency rank prediction. Our model includes three novel modules: Spatial Mask Module (SMM), Selective Attention Module (SAM) and Salient Instance Edge Module (SIEM). SMM integrates bottom-up and semantic object properties to enhance contextual object features, from which SAM learns the dependencies between object features and image features for saliency reasoning. SIEM is designed to improve segmentation of salient objects, which helps further improve their rank predictions. Experimental results show that our proposed network achieves state-of-the-art performances on the salient object ranking task across multiple datasets. Code and data are available at <jats:ext-link xmlns:xlink=\"http:\/\/www.w3.org\/1999\/xlink\" ext-link-type=\"uri\" xlink:href=\"https:\/\/github.com\/SirisAvishek\/Attention_Shift_Ranks\">https:\/\/github.com\/SirisAvishek\/Attention_Shift_Ranks<\/jats:ext-link>.<\/jats:p>","DOI":"10.1007\/s11263-023-01906-7","type":"journal-article","created":{"date-parts":[[2023,10,18]],"date-time":"2023-10-18T08:02:39Z","timestamp":1697616159000},"page":"964-986","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Inferring Attention Shifts for Salient Instance Ranking"],"prefix":"10.1007","volume":"132","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3064-2202","authenticated-orcid":false,"given":"Avishek","family":"Siris","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianbo","family":"Jiao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gary K. L.","family":"Tam","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xianghua","family":"Xie","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rynson W. H.","family":"Lau","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,10,18]]},"reference":[{"key":"1906_CR1","unstructured":"Abdulla, W. (2017). Mask r-cnn for object detection and instance segmentation on keras and tensorflow. https:\/\/github.com\/matterport\/Mask_RCNN."},{"key":"1906_CR2","doi-asserted-by":"crossref","unstructured":"Anderson, P., He, X., Buehler, C., Teney, D., Johnson, M., Gould, S., & Zhang, L. (2018). Bottom-up and top-down attention for image captioning and visual question answering. In CVPR, pp. 6077\u20136086.","DOI":"10.1109\/CVPR.2018.00636"},{"key":"1906_CR3","doi-asserted-by":"crossref","unstructured":"Arvanitis, G., Stagakis, N., Zacharaki, E.\u00a0I., & Moustakas, K. (2023). Cooperative saliency-based obstacle detection and ar rendering for increased situational awareness. arXiv preprint arXiv:2302.00916.","DOI":"10.1109\/TITS.2023.3327494"},{"key":"1906_CR4","doi-asserted-by":"crossref","unstructured":"Borji, A. (2012). Boosting bottom-up and top-down visual features for saliency estimation. In CVPR, pp. 438\u2013445.","DOI":"10.1109\/CVPR.2012.6247706"},{"key":"1906_CR5","unstructured":"Borji, A. (2018). Saliency prediction in the deep learning era: Successes, limitations, and future challenges. arXiv preprint arXiv:1810.03716."},{"key":"1906_CR6","doi-asserted-by":"crossref","unstructured":"Borji, A. & Itti, L. (2012). Exploiting local and global patch rarities for saliency detection. In CVPR, pp. 478\u2013485.","DOI":"10.1109\/CVPR.2012.6247711"},{"key":"1906_CR7","doi-asserted-by":"crossref","unstructured":"Borji, A., Sihite, D.\u00a0N., & Itti, L. (2012). Probabilistic learning of task-specific visual attention. In CVPR, pp. 470\u2013477.","DOI":"10.1109\/CVPR.2012.6247710"},{"key":"1906_CR8","doi-asserted-by":"crossref","unstructured":"Cao, C., Liu, X., Yang, Y., Yu, Y., Wang, J., Wang, Z., Huang, Y., Wang, L., Huang, C., Xu, W., et\u00a0al. (2015). Look and think twice: Capturing top-down visual attention with feedback convolutional neural networks. In ICCV, pp. 2956\u20132964.","DOI":"10.1109\/ICCV.2015.338"},{"key":"1906_CR9","doi-asserted-by":"crossref","unstructured":"Cao, Z., Qin, T., Liu, T.-Y., Tsai, M.-F., & Li, H. (2007). Learning to rank: from pairwise approach to listwise approach. In ICML, pp. 129\u2013136.","DOI":"10.1145\/1273496.1273513"},{"key":"1906_CR10","unstructured":"Chang, C.-K., Siagian, C., & Itti, L. (2010). Mobile robot vision navigation & localization using gist and saliency. In IROS, pp. 4147\u20134154. IEEE."},{"key":"1906_CR11","doi-asserted-by":"crossref","unstructured":"Chen, X., Lian, Y., Jiao, L., Wang, H., Gao, Y., & Lingling, S. (2020). Supervised edge attention network for accurate image instance segmentation. In ECCV 2020, pp. 617\u2013631. Springer.","DOI":"10.1007\/978-3-030-58583-9_37"},{"key":"1906_CR12","doi-asserted-by":"crossref","unstructured":"Cheng, T., Wang, X., Huang, L., & Liu, W. (2020). Boundary-preserving mask r-cnn. In ECCV, pp. 660\u2013676. Springer.","DOI":"10.1007\/978-3-030-58568-6_39"},{"issue":"2","key":"1906_CR13","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3177745","volume":"14","author":"M Cornia","year":"2018","unstructured":"Cornia, M., Baraldi, L., Serra, G., & Cucchiara, R. (2018). Paying more attention to saliency: Image captioning with saliency and context attention. TOMM, 14(2), 1\u201321.","journal-title":"TOMM"},{"issue":"1","key":"1906_CR14","doi-asserted-by":"publisher","first-page":"193","DOI":"10.1146\/annurev.ne.18.030195.001205","volume":"18","author":"R Desimone","year":"1995","unstructured":"Desimone, R., & Duncan, J. (1995). Neural mechanisms of selective visual attention. Annual Review of Neuroscience, 18(1), 193\u2013222.","journal-title":"Annual Review of Neuroscience"},{"issue":"14","key":"1906_CR15","doi-asserted-by":"publisher","first-page":"18","DOI":"10.1167\/8.14.18","volume":"8","author":"W Einh\u00e4user","year":"2008","unstructured":"Einh\u00e4user, W., Spain, M., & Perona, P. (2008). Objects predict fixations better than early saliency. Journal of Vision, 8(14), 18\u201318.","journal-title":"Journal of Vision"},{"key":"1906_CR16","doi-asserted-by":"crossref","unstructured":"Fan, D.-P., Wang, W., Cheng, M.-M., & Shen, J. (2019a). Shifting more attention to video salient object detection. In CVPR, pp. 8554\u20138564.","DOI":"10.1109\/CVPR.2019.00875"},{"key":"1906_CR17","doi-asserted-by":"crossref","unstructured":"Fan, R., Cheng, M.-M., Hou, Q., Mu, T.-J., Wang, J., & Hu, S.-M. (2019b). S4net: Single stage salient-instance segmentation. In CVPR, pp. 6103\u20136112.","DOI":"10.1109\/CVPR.2019.00626"},{"key":"1906_CR18","doi-asserted-by":"crossref","unstructured":"Fang, H., Zhang, D., Zhang, Y., Chen, M., Li, J., Hu, Y., Cai, D., and He, X. (2021). Salient object ranking with position-preserved attention. In ICCV, pp. 16331\u201316341.","DOI":"10.1109\/ICCV48922.2021.01602"},{"key":"1906_CR19","unstructured":"Feng, J., Wei, Y., Tao, L., Zhang, C., & Sun, J. (2011). Salient object detection by composition. In ICCV, pp. 1028\u20131035."},{"key":"1906_CR20","doi-asserted-by":"crossref","unstructured":"Feng, M., Lu, H., & Ding, E. (2019). Attentive feedback network for boundary-aware salient object detection. In CVPR, pp. 1623\u20131632.","DOI":"10.1109\/CVPR.2019.00172"},{"issue":"6","key":"1906_CR21","doi-asserted-by":"publisher","first-page":"989","DOI":"10.1109\/TPAMI.2009.27","volume":"31","author":"D Gao","year":"2009","unstructured":"Gao, D., Han, S., & Vasconcelos, N. (2009). Discriminant saliency, the detection of suspicious coincidences, and applications to visual recognition. TPAMI, 31(6), 989\u20131005.","journal-title":"TPAMI"},{"key":"1906_CR22","doi-asserted-by":"crossref","unstructured":"Gao, S.-H., Tan, Y.-Q., Cheng, M.-M., Lu, C., Chen, Y., & Yan, S. (2020). Highly efficient salient object detection with 100k parameters. In ECCV, pp. 702\u2013721. Springer.","DOI":"10.1007\/978-3-030-58539-6_42"},{"key":"1906_CR23","doi-asserted-by":"crossref","unstructured":"Gorji, S. & Clark, J.\u00a0J. (2017). Attentional push: A deep convolutional network for augmenting image salience with shared attention modeling in social scenes. In CVPR, pp. 2510\u20132519.","DOI":"10.1109\/CVPR.2017.370"},{"key":"1906_CR24","doi-asserted-by":"crossref","unstructured":"He, K., Gkioxari, G., Doll\u00e1r, P., & Girshick, R. (2017a). Mask R-CNN. In ICCV, pp. 2980\u20132988.","DOI":"10.1109\/ICCV.2017.322"},{"key":"1906_CR25","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In CVPR, pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"1906_CR26","doi-asserted-by":"crossref","unstructured":"He, S., Jiao, J., Zhang, X., Han, G., & Lau, R.\u00a0W. (2017b). Delving into salient object subitizing and detection. In ICCV, pp. 1059\u20131067.","DOI":"10.1109\/ICCV.2017.120"},{"key":"1906_CR27","doi-asserted-by":"crossref","unstructured":"Hou, Q., Cheng, M.-M., Hu, X., Borji, A., Tu, Z., & Torr, P.\u00a0H. (2017). Deeply supervised salient object detection with short connections. In CVPR, pp. 3203\u20133212.","DOI":"10.1109\/CVPR.2017.563"},{"key":"1906_CR28","doi-asserted-by":"crossref","unstructured":"Islam, M.\u00a0A., Kalash, M., & Bruce, N. D.\u00a0B. (2018). Revisiting salient object detection: Simultaneous detection, ranking, and subitizing of multiple salient objects. In CVPR, pp. 7142\u20137150.","DOI":"10.1109\/CVPR.2018.00746"},{"key":"1906_CR29","doi-asserted-by":"crossref","unstructured":"Itti, L. & Koch, C. (1999). Comparison of feature combination strategies for saliency-based visual attention systems. In Human Vision and Electronic Imaging IV, vol. 3644, pp. 473\u2013482. International Society for Optics and Photonics.","DOI":"10.1117\/12.348467"},{"issue":"10\u201312","key":"1906_CR30","doi-asserted-by":"publisher","first-page":"1489","DOI":"10.1016\/S0042-6989(99)00163-7","volume":"40","author":"L Itti","year":"2000","unstructured":"Itti, L., & Koch, C. (2000). A saliency-based search mechanism for overt and covert shifts of visual attention. Vision Research, 40(10\u201312), 1489\u20131506.","journal-title":"Vision Research"},{"issue":"11","key":"1906_CR31","doi-asserted-by":"publisher","first-page":"1254","DOI":"10.1109\/34.730558","volume":"20","author":"L Itti","year":"1998","unstructured":"Itti, L., Koch, C., & Niebur, E. (1998). A model of saliency-based visual attention for rapid scene analysis. TPAMI, 20(11), 1254\u20131259.","journal-title":"TPAMI"},{"key":"1906_CR32","doi-asserted-by":"crossref","unstructured":"Jiang, M., Huang, S., Duan, J., & Zhao, Q. (2015). Salicon: Saliency in context. In CVPR, pp. 1072\u20131080.","DOI":"10.1109\/CVPR.2015.7298710"},{"key":"1906_CR33","doi-asserted-by":"crossref","unstructured":"Jiao, J., Wei, Y., Jie, Z., Shi, H., Lau, R.\u00a0W., & Huang, T.\u00a0S. (2019). Geometry-aware distillation for indoor semantic segmentation. In CVPR, pp. 2869\u20132878.","DOI":"10.1109\/CVPR.2019.00298"},{"key":"1906_CR34","doi-asserted-by":"crossref","unstructured":"Judd, T., Ehinger, K., Durand, F., & Torralba, A. (2009). Learning to predict where humans look. In ICCV, pp. 2106\u20132113.","DOI":"10.1109\/ICCV.2009.5459462"},{"issue":"1","key":"1906_CR35","first-page":"204","volume":"43","author":"M Kalash","year":"2019","unstructured":"Kalash, M., Islam, M. A., & Bruce, N. D. (2019). Relative saliency and ranking: Models, metrics, data and benchmarks. TPAMI, 43(1), 204\u2013219.","journal-title":"TPAMI"},{"key":"1906_CR36","doi-asserted-by":"crossref","unstructured":"Kaufman, E. L., Lord, M. W., Reese, T. W., & Volkmann, J. (1949). The discrimination of visual number. AJP, 62(4), 498\u2013525.","DOI":"10.2307\/1418556"},{"key":"1906_CR37","doi-asserted-by":"crossref","unstructured":"Ke, L., Tai, Y.-W., & Tang, C.-K. (2021). Deep occlusion-aware instance segmentation with overlapping bilayers. In CVPR, pp. 4019\u20134028.","DOI":"10.1109\/CVPR46437.2021.00401"},{"key":"1906_CR38","doi-asserted-by":"crossref","unstructured":"Kim, M., Woo, S., Kim, D., & Kweon, I.\u00a0S. (2021). The devil is in the boundary: Exploiting boundary representation for basis-based instance segmentation. In WACV, pp. 929\u2013938.","DOI":"10.1109\/WACV48630.2021.00097"},{"key":"1906_CR39","doi-asserted-by":"crossref","unstructured":"Koch, C. & Ullman, S. (1987). Shifts in selective visual attention: towards the underlying neural circuitry. In Matters of Intelligence, pp. 115\u2013141. Springer.","DOI":"10.1007\/978-94-009-3833-5_5"},{"key":"1906_CR40","doi-asserted-by":"crossref","unstructured":"Lai, B. & Gong, X. (2016). Saliency guided dictionary learning for weakly-supervised image parsing. In CVPR, pp. 3630\u20133639.","DOI":"10.1109\/CVPR.2016.395"},{"key":"1906_CR41","doi-asserted-by":"crossref","unstructured":"Li, A., Zhang, J., Lv, Y., Liu, B., Zhang, T., & Dai, Y. (2021). Uncertainty-aware joint salient object and camouflaged object detection. In CVPR, pp. 10071\u201310081.","DOI":"10.1109\/CVPR46437.2021.00994"},{"key":"1906_CR42","unstructured":"Li, G. & Yu, Y. (2015). Visual saliency based on multiscale deep features. In CVPR, pp. 5455\u20135463."},{"key":"1906_CR43","first-page":"239","volume":"107","author":"J Li","year":"2014","unstructured":"Li, J., Tian, Y., & Huang, T. (2014). Visual saliency with statistical priors. IJCV, 107, 239\u2013253.","journal-title":"Visual saliency with statistical priors. IJCV"},{"issue":"4","key":"1906_CR44","first-page":"1513","volume":"21","author":"J Li","year":"2012","unstructured":"Li, J., Xu, D., & Gao, W. (2012). Removing label ambiguity in learning-based visual saliency estimation. TIP, 21(4), 1513\u20131525.","journal-title":"TIP"},{"key":"1906_CR45","doi-asserted-by":"crossref","unstructured":"Li, X., Yang, F., Cheng, H., Liu, W., & Shen, D. (2018). Contour knowledge transfer for salient object detection. In ECCV, pp. 355\u2013370.","DOI":"10.1007\/978-3-030-01267-0_22"},{"key":"1906_CR46","doi-asserted-by":"crossref","unstructured":"Li, Y., Hou, X., Koch, C., Rehg, J.\u00a0M., & Yuille, A.\u00a0L. (2014b). The secrets of salient object segmentation. In CVPR, pp. 280\u2013287.","DOI":"10.1109\/CVPR.2014.43"},{"key":"1906_CR47","doi-asserted-by":"crossref","unstructured":"Lin, T.-Y., Doll\u00e1r, P., Girshick, R., He, K., Hariharan, B., & Belongie, S. (2017). Feature pyramid networks for object detection. In CVPR, pp. 2117\u20132125.","DOI":"10.1109\/CVPR.2017.106"},{"key":"1906_CR48","doi-asserted-by":"crossref","unstructured":"Lin, T.-Y., Maire, M., Belongie, S.\u00a0J., Bourdev, L.\u00a0D., Girshick, R.\u00a0B., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C.\u00a0L. (2014). Microsoft coco: Common objects in context. In ECCV, pp. 740\u2013755.","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"1906_CR49","doi-asserted-by":"crossref","unstructured":"Liu, J.-J., Hou, Q., Cheng, M.-M., Feng, J., & Jiang, J. (2019). A simple pooling-based design for real-time salient object detection. In CVPR, pp. 3917\u20133926.","DOI":"10.1109\/CVPR.2019.00404"},{"key":"1906_CR50","doi-asserted-by":"crossref","unstructured":"Liu, N., Han, J., & Yang, M.-H. (2018). Picanet: Learning pixel-wise contextual attention for saliency detection. In CVPR, pp. 3089\u20133098.","DOI":"10.1109\/CVPR.2018.00326"},{"key":"1906_CR51","doi-asserted-by":"crossref","unstructured":"Liu, N., Li, L., Zhao, W., Han, J., & Shao, L. (2021a). Instance-level relative saliency ranking with graph reasoning. TPAMI.","DOI":"10.1109\/TPAMI.2021.3107872"},{"key":"1906_CR52","doi-asserted-by":"crossref","unstructured":"Liu, N., Zhang, N., Wan, K., Shao, L., & Han, J. (2021b). Visual saliency transformer. In ICCV, pp. 4722\u20134732.","DOI":"10.1109\/ICCV48922.2021.00468"},{"key":"1906_CR53","doi-asserted-by":"crossref","unstructured":"Lu, C., Krishna, R., Bernstein, M., & Fei-Fei, L. (2016). Visual relationship detection with language priors. In ECCV, pp. 852\u2013869. Springer.","DOI":"10.1007\/978-3-319-46448-0_51"},{"key":"1906_CR54","doi-asserted-by":"crossref","unstructured":"Lv, Y., Zhang, J., Dai, Y., Li, A., Liu, B., Barnes, N., & Fan, D.-P. (2021). Simultaneously localize, segment and rank the camouflaged objects. In CVPR, pp. 11591\u201311601.","DOI":"10.1109\/CVPR46437.2021.01142"},{"key":"1906_CR55","doi-asserted-by":"crossref","unstructured":"Ma, C.-Y., Kadav, A., Melvin, I., Kira, Z., AlRegib, G., & Peter\u00a0Graf, H. (2018). Attend and interact: Higher-order object interactions for video understanding. In CVPR, pp. 6790\u20136800.","DOI":"10.1109\/CVPR.2018.00710"},{"key":"1906_CR56","unstructured":"Marden, J. I. (1996). Analyzing and modeling rank data. CRC Press."},{"key":"1906_CR57","doi-asserted-by":"crossref","unstructured":"Miao, J., Wei, Y., Wu, Y., Liang, C., Li, G., & Yang, Y. (2021). Vspw: A large-scale dataset for video scene parsing in the wild. In CVPR, pp. 4133\u20134143.","DOI":"10.1109\/CVPR46437.2021.00412"},{"key":"1906_CR58","doi-asserted-by":"crossref","unstructured":"Neisser, U. (2014). Cognitive Psychology: Classic Edition. Psychology Press.","DOI":"10.4324\/9781315736174"},{"issue":"7","key":"1906_CR59","doi-asserted-by":"publisher","first-page":"1720","DOI":"10.1109\/TPAMI.2018.2845370","volume":"41","author":"A Palazzi","year":"2018","unstructured":"Palazzi, A., Abati, D., Solera, F., & Cucchiara, R. (2018). Predicting the driver\u2019s focus of attention: the dr (eye) ve project. TPAMI, 41(7), 1720\u20131733.","journal-title":"TPAMI"},{"key":"1906_CR60","doi-asserted-by":"crossref","unstructured":"Pan, J., Sayrol, E., Giro-i Nieto, X., McGuinness, K., & O\u2019Connor, N.\u00a0E. (2016). Shallow and deep convolutional networks for saliency prediction. In CVPR, pp. 598\u2013606.","DOI":"10.1109\/CVPR.2016.71"},{"key":"1906_CR61","doi-asserted-by":"crossref","unstructured":"Pang, Y., Zhao, X., Zhang, L., & Lu, H. (2020). Multi-scale interactive network for salient object detection. In CVPR, pp. 9413\u20139422.","DOI":"10.1109\/CVPR42600.2020.00943"},{"issue":"9","key":"1906_CR62","doi-asserted-by":"publisher","first-page":"2262","DOI":"10.1109\/TMM.2017.2757759","volume":"22","author":"JH Park","year":"2017","unstructured":"Park, J. H., Gutenko, I., & Kaufman, A. E. (2017). Transfer function-guided saliency-aware compression for transmitting volumetric data. IEEE Transactions on Multimedia, 22(9), 2262\u20132277.","journal-title":"IEEE Transactions on Multimedia"},{"key":"1906_CR63","doi-asserted-by":"crossref","unstructured":"Peters, R.\u00a0J. & Itti, L. (2007). Beyond bottom-up: Incorporating task-dependent influences into a computational model of spatial attention. In CVPR, pp. 1\u20138.","DOI":"10.1109\/CVPR.2007.383337"},{"key":"1906_CR64","doi-asserted-by":"crossref","unstructured":"Qin, X., Zhang, Z., Huang, C., Gao, C., Dehghan, M., & Jagersand, M. (2019). Basnet: Boundary-aware salient object detection. In CVPR, pp. 7479\u20137489.","DOI":"10.1109\/CVPR.2019.00766"},{"key":"1906_CR65","unstructured":"Recasens, A., Khosla, A., Vondrick, C., & Torralba, A. (2015). Where are they looking? In NeurIPS, pp. 199\u2013207."},{"issue":"1","key":"1906_CR66","doi-asserted-by":"publisher","first-page":"139","DOI":"10.1007\/s12369-012-0174-7","volume":"5","author":"G Schillaci","year":"2013","unstructured":"Schillaci, G., Bodiro\u017ea, S., & Hafner, V. V. (2013). Evaluating the effect of saliency detection and attention manipulation in human-robot interaction. International Journal of Social Robotics, 5(1), 139\u2013152.","journal-title":"International Journal of Social Robotics"},{"key":"1906_CR67","doi-asserted-by":"crossref","unstructured":"Siris, A., Jiao, J., Tam, G.\u00a0K., Xie, X., & Lau, R.\u00a0W. (2020). Inferring attention shift ranks of objects for image saliency. In CVPR, pp. 12133\u201312143.","DOI":"10.1109\/CVPR42600.2020.01215"},{"key":"1906_CR68","doi-asserted-by":"crossref","unstructured":"Siris, A., Jiao, J., Tam, G.\u00a0K., Xie, X., & Lau, R.\u00a0W. (2021). Scene context-aware salient object detection. In ICCV, pp. 4156\u20134166.","DOI":"10.1109\/ICCV48922.2021.00412"},{"issue":"4","key":"1906_CR69","first-page":"1633","volume":"24","author":"V Sitzmann","year":"2018","unstructured":"Sitzmann, V., Serrano, A., Pavel, A., Agrawala, M., Gutierrez, D., Masia, B., & Wetzstein, G. (2018). Saliency in vr: How do people explore virtual environments? TVCG, 24(4), 1633\u20131642.","journal-title":"TVCG"},{"key":"1906_CR70","doi-asserted-by":"crossref","unstructured":"Siva, P., Russell, C., Xiang, T., & Agapito, L. (2013). Looking beyond the image: Unsupervised learning for object saliency and detection. In CVPR, pp. 3238\u20133245.","DOI":"10.1109\/CVPR.2013.416"},{"key":"1906_CR71","doi-asserted-by":"crossref","unstructured":"Song, H., Wang, W., Zhao, S., Shen, J., & Lam, K.-M. (2018). Pyramid dilated deeper convlstm for video salient object detection. In ECCV, pp. 715\u2013731.","DOI":"10.1007\/978-3-030-01252-6_44"},{"key":"1906_CR72","doi-asserted-by":"crossref","unstructured":"Su, J., Li, J., Zhang, Y., Xia, C., & Tian, Y. (2019). Selectivity or invariance: Boundary-aware salient object detection. In ICCV, pp. 3799\u20133808.","DOI":"10.1109\/ICCV.2019.00390"},{"key":"1906_CR73","unstructured":"Tang, L., Li, B., Zhong, Y., Ding, S., & Song, M. (2021). Disentangled high quality salient object detection. In ICCV, pp. 3580\u20133590."},{"key":"1906_CR74","doi-asserted-by":"crossref","unstructured":"Tavakoli, H.\u00a0R., Shetty, R., Borji, A., & Laaksonen, J. (2017). Paying attention to descriptions generated by image captioning models. In ICCV, pp. 2487\u20132496.","DOI":"10.1109\/ICCV.2017.272"},{"issue":"7","key":"1906_CR75","doi-asserted-by":"publisher","first-page":"1407","DOI":"10.1364\/JOSAA.20.001407","volume":"20","author":"A Torralba","year":"2003","unstructured":"Torralba, A. (2003). Modeling global scene factors in attention. JOSA A, 20(7), 1407\u201318.","journal-title":"JOSA A"},{"key":"1906_CR76","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.\u00a0N., Kaiser, L., & Polosukhin, I. (2017). Attention is all you need. In NeurIPS, pp. 5998\u20136008."},{"key":"1906_CR77","doi-asserted-by":"crossref","unstructured":"Wang, F., Jiang, M., Qian, C., Yang, S., Li, C., Zhang, H., Wang, X., & Tang, X. (2017a). Residual attention network for image classification. In CVPR, pp. 3156\u20133164.","DOI":"10.1109\/CVPR.2017.683"},{"key":"1906_CR78","doi-asserted-by":"crossref","unstructured":"Wang, L., Lu, H., Wang, Y., Feng, M., Wang, D., Yin, B., & Ruan, X. (2017b). Learning to detect salient objects with image-level supervision. In CVPR, pp. 136\u2013145.","DOI":"10.1109\/CVPR.2017.404"},{"key":"1906_CR79","doi-asserted-by":"crossref","unstructured":"Wang, T., Zhang, L., Wang, S., Lu, H., Yang, G., Ruan, X., & Borji, A. (2018a). Detect globally, refine locally: A novel approach to saliency detection. In CVPR, pp. 3127\u20133135.","DOI":"10.1109\/CVPR.2018.00330"},{"key":"1906_CR80","doi-asserted-by":"crossref","unstructured":"Wang, W., Shen, J., Cheng, M.-M., & Shao, L. (2019a). An iterative and cooperative top-down and bottom-up inference network for salient object detection. In CVPR, pp. 5968\u20135977.","DOI":"10.1109\/CVPR.2019.00612"},{"key":"1906_CR81","doi-asserted-by":"crossref","unstructured":"Wang, W., Shen, J., Dong, X., & Borji, A. (2018b). Salient object detection driven by fixation prediction. In CVPR, pp. 1711\u20131720.","DOI":"10.1109\/CVPR.2018.00184"},{"key":"1906_CR82","doi-asserted-by":"crossref","unstructured":"Wang, W., Zhao, S., Shen, J., Hoi, S.\u00a0C., & Borji, A. (2019b). Salient object detection with pyramid attention and salient edges. In CVPR, pp. 1448\u20131457.","DOI":"10.1109\/CVPR.2019.00154"},{"key":"1906_CR83","doi-asserted-by":"crossref","unstructured":"Wang, X., Girshick, R., Gupta, A., & He, K. (2018c). Non-local neural networks. In CVPR, pp. 7794\u20137803.","DOI":"10.1109\/CVPR.2018.00813"},{"key":"1906_CR84","unstructured":"Wang, X., Zhu, L., Wu, Y., & Yang, Y. (2020). Symbiotic attention for egocentric action recognition with object-centric alignment. TPAMI."},{"key":"1906_CR85","unstructured":"Wang, Y., Wang, L., Li, Y., He, D., & Liu, T.-Y. (2013). A theoretical analysis of ndcg type ranking measures. In COLT, pp. 25\u201354. PMLR."},{"key":"1906_CR86","doi-asserted-by":"crossref","unstructured":"Wei, J., Wang, S., Wu, Z., Su, C., Huang, Q., & Tian, Q. (2020). Label decoupling framework for salient object detection. In CVPR, pp. 13025\u201313034.","DOI":"10.1109\/CVPR42600.2020.01304"},{"key":"1906_CR87","doi-asserted-by":"crossref","unstructured":"Wu, Z., Su, L., & Huang, Q. (2019a). Cascaded partial decoder for fast and accurate salient object detection. In CVPR, pp. 3907\u20133916.","DOI":"10.1109\/CVPR.2019.00403"},{"key":"1906_CR88","doi-asserted-by":"crossref","unstructured":"Wu, Z., Su, L., & Huang, Q. (2019b). Stacked cross refinement network for edge-aware salient object detection. In ICCV, pp. 7264\u20137273.","DOI":"10.1109\/ICCV.2019.00736"},{"key":"1906_CR89","doi-asserted-by":"crossref","unstructured":"Xia, F., Liu, T.-Y., Wang, J., Zhang, W., & Li, H. (2008). Listwise approach to learning to rank: theory and algorithm. In ICML, pp. 1192\u20131199.","DOI":"10.1145\/1390156.1390306"},{"issue":"1","key":"1906_CR90","doi-asserted-by":"publisher","first-page":"28","DOI":"10.1167\/14.1.28","volume":"14","author":"J Xu","year":"2014","unstructured":"Xu, J., Jiang, M., Wang, S., Kankanhalli, M. S., & Zhao, Q. (2014). Predicting human gaze beyond pixels. Journal of Vision, 14(1), 28\u201328.","journal-title":"Journal of Vision"},{"key":"1906_CR91","unstructured":"Xu, K., Ba, J., Kiros, R., Cho, K., Courville, A., Salakhudinov, R., Zemel, R., & Bengio, Y. (2015a). Show, attend and tell: Neural image caption generation with visual attention. In ICML, pp. 2048\u20132057."},{"key":"1906_CR92","doi-asserted-by":"crossref","unstructured":"Xu, M., Ren, Y., & Wang, Z. (2015b). Learning to predict saliency on face images. In ICCV, pp. 3907\u20133915.","DOI":"10.1109\/ICCV.2015.445"},{"key":"1906_CR93","doi-asserted-by":"crossref","unstructured":"Yan, Q., Xu, L., Shi, J., & Jia, J. (2013). Hierarchical saliency detection. In CVPR, pp. 1155\u20131162.","DOI":"10.1109\/CVPR.2013.153"},{"key":"1906_CR94","doi-asserted-by":"crossref","unstructured":"Yang, C., Zhang, L., Lu, H., Ruan, X., & Yang, M.-H. (2013). Saliency detection via graph-based manifold ranking. In CVPR, pp. 3166\u20133173.","DOI":"10.1109\/CVPR.2013.407"},{"key":"1906_CR95","doi-asserted-by":"crossref","unstructured":"Yang, Z., He, X., Gao, J., Deng, L., & Smola, A. (2016). Stacked attention networks for image question answering. In CVPR, pp. 21\u201329.","DOI":"10.1109\/CVPR.2016.10"},{"key":"1906_CR96","doi-asserted-by":"crossref","unstructured":"Zhang, J., Sclaroff, S., Lin, Z., Shen, X., Price, B., & Mech, R. (2016a). Unconstrained salient object detection via proposal subset optimization. In CVPR, pp. 5733\u20135742.","DOI":"10.1109\/CVPR.2016.618"},{"key":"1906_CR97","doi-asserted-by":"crossref","unstructured":"Zhang, L., Dai, J., Lu, H., He, Y., & Wang, G. (2018). A bi-directional message passing model for salient object detection. In CVPR, pp. 1741\u20131750.","DOI":"10.1109\/CVPR.2018.00187"},{"key":"1906_CR98","doi-asserted-by":"crossref","unstructured":"Zhang, L., Tong, M. H., Marks, T. K., Shan, H., & Cottrell, G. W. (2008). Sun: A bayesian framework for saliency using natural statistics. Journal of Vision, 8(7), 32\u201332.","DOI":"10.1167\/8.7.32"},{"key":"1906_CR99","doi-asserted-by":"crossref","unstructured":"Zhang, L., Yang, C., Lu, H., Ruan, X., & Yang, M.-H. (2016). Ranking saliency. TPAMI, 39, 1892\u20131904.","DOI":"10.1109\/TPAMI.2016.2609426"},{"key":"1906_CR100","doi-asserted-by":"crossref","unstructured":"Zhang, P., Wang, D., Lu, H., Wang, H., & Ruan, X. (2017). Amulet: Aggregating multi-level convolutional features for salient object detection. In ICCV, pp. 202\u2013211.","DOI":"10.1109\/ICCV.2017.31"},{"key":"1906_CR101","doi-asserted-by":"crossref","unstructured":"Zhao, J.-X., Liu, J.-J., Fan, D.-P., Cao, Y., Yang, J., & Cheng, M.-M. (2019). Egnet: Edge guidance network for salient object detection. In ICCV, pp. 8779\u20138788.","DOI":"10.1109\/ICCV.2019.00887"},{"key":"1906_CR102","doi-asserted-by":"crossref","unstructured":"Zhao, R., Ouyang, W., & Wang, X. (2013). Person re-identification by salience matching. In ICCV, pp. 2528\u20132535.","DOI":"10.1109\/ICCV.2013.314"},{"key":"1906_CR103","doi-asserted-by":"crossref","unstructured":"Zhao, T. & Wu, X. (2019). Pyramid feature attention network for saliency detection. In CVPR, pp. 3085\u20133094.","DOI":"10.1109\/CVPR.2019.00320"},{"key":"1906_CR104","doi-asserted-by":"crossref","unstructured":"Zhao, X., Pang, Y., Zhang, L., Lu, H., & Zhang, L. (2020). Suppress and balance: A simple gated network for salient object detection. In ECCV, pp. 35\u201351. Springer.","DOI":"10.1007\/978-3-030-58536-5_3"},{"key":"1906_CR105","doi-asserted-by":"crossref","unstructured":"Zhou, H., Xie, X., Lai, J.-H., Chen, Z., & Yang, L. (2020). Interactive two-stream decoder for accurate and fast saliency detection. In CVPR, pp. 9141\u20139150.","DOI":"10.1109\/CVPR42600.2020.00916"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01906-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-023-01906-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01906-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,2,19]],"date-time":"2024-02-19T21:15:36Z","timestamp":1708377336000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-023-01906-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,18]]},"references-count":105,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2024,3]]}},"alternative-id":["1906"],"URL":"https:\/\/doi.org\/10.1007\/s11263-023-01906-7","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"type":"print","value":"0920-5691"},{"type":"electronic","value":"1573-1405"}],"subject":[],"published":{"date-parts":[[2023,10,18]]},"assertion":[{"value":"26 June 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 August 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 October 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors have no competing interests to declare that are relevant to the content of this manuscript.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}