{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,13]],"date-time":"2026-07-13T10:46:27Z","timestamp":1783939587907,"version":"3.55.0"},"reference-count":157,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"2","license":[{"start":{"date-parts":[[2021,2,1]],"date-time":"2021-02-01T00:00:00Z","timestamp":1612137600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,2,1]],"date-time":"2021-02-01T00:00:00Z","timestamp":1612137600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,2,1]],"date-time":"2021-02-01T00:00:00Z","timestamp":1612137600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2021,2,1]]},"DOI":"10.1109\/tpami.2019.2935715","type":"journal-article","created":{"date-parts":[[2019,8,22]],"date-time":"2019-08-22T18:59:01Z","timestamp":1566500341000},"page":"679-700","source":"Crossref","is-referenced-by-count":130,"title":["Saliency Prediction in the Deep Learning Era: Successes and Limitations"],"prefix":"10.1109","volume":"43","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8198-0335","authenticated-orcid":false,"given":"Ali","family":"Borji","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1167\/14.8.5"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_37"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6247710"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00785"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-15561-1_3"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_18"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00514"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2014.2366154"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1007\/s12559-010-9074-z"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/IVS.2017.7995833"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10584-0_2"},{"key":"ref27","article-title":"Understanding infographics through textual and visual tag prediction","author":"bylinskii","year":"2017","journal-title":"arXiv 1709 09215 [cs]"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10584-0_3"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1016\/S0042-6989(01)00250-4"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298710"},{"key":"ref21","first-page":"155","article-title":"Saliency based on information maximization","author":"bruce","year":"2005","journal-title":"Proc 18th Int Conf Neural Inf Process Syst"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/QoMEX.2013.6603239"},{"key":"ref23","article-title":"BubbleView: An alternative to eye-tracking for crowdsourcing image importance","author":"kim","year":"2017"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2009.5459462"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1167\/14.1.28"},{"key":"ref25","article-title":"MIT saliency benchmark.","author":"bylinskii","year":"2015"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1016\/j.visres.2014.10.027"},{"key":"ref51","first-page":"545","article-title":"Graph-based visual saliency","author":"harel","year":"2006","journal-title":"Proc 19th Int Conf Neural Inf Process Syst"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00862"},{"key":"ref153","article-title":"Faster gaze prediction with dense networks and fisher pruning","author":"theis","year":"2018","journal-title":"arXiv 1801 05787"},{"key":"ref156","article-title":"Light-weighted saliency detection with distinctively lower memory cost and model size","author":"xiao","year":"2019","journal-title":"arXiv 1901 05002"},{"key":"ref155","article-title":"Object detectors emerge in deep scene cnns","author":"zhou","year":"2015","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.354"},{"key":"ref152","article-title":"Guiding human gaze with convolutional neural networks","author":"gatys","year":"2017","journal-title":"arXiv 1712 06492"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1016\/j.neuron.2015.09.042"},{"key":"ref146","first-page":"2048","article-title":"Show, attend and tell: Neural image caption generation with visual attention","author":"xu","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2016.2522380"},{"key":"ref148","first-page":"3664","article-title":"High-order attention models for visual question answering","author":"schwartz","year":"2017","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref149","first-page":"289","article-title":"Hierarchical question-image co-attention for visual question answering","author":"lu","year":"2016","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.152"},{"key":"ref58","first-page":"1","article-title":"Spatio-temporal saliency detection using phase spectrum of quaternion fourier transform","author":"guo","year":"2008","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2016.2628583"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299189"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2567391"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.26"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2011.11.007"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2007.383267"},{"key":"ref40","first-page":"4420","article-title":"Predicting salient face in multipleface videos","author":"liu","year":"2017","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.89"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/34.730558"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.2013.2279715"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1016\/j.tics.2005.02.009"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2012.2210727"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1167\/9.12.10"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46454-1_49"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2018.10.009"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1016\/j.visres.2013.07.016"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.1510393112"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1167\/8.7.32"},{"key":"ref48","first-page":"219","article-title":"Shifts in selective visual attention: Towards the underlying neural circuitry","volume":"4","author":"koch","year":"1985","journal-title":"Hum Neurobiol"},{"key":"ref47","article-title":"Learning a saliency evaluation metric using crowdsourced perceptual judgments","author":"xia","year":"0","journal-title":"arXiv 1806 10257"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2017.275"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01234-2_30"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1016\/j.visres.2005.03.019"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1023\/A:1026543900054"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1016\/j.visres.2012.06.001"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.0506162102"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.3389\/fpsyg.2013.00455"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1167\/8.3.3"},{"key":"ref73","first-page":"2672","article-title":"Generative adversarial nets","author":"goodfellow","year":"2014","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref72","article-title":"Salgan: Visual saliency prediction with generative adversarial networks","author":"pan","year":"2017","journal-title":"arXiv 1701 01081"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1167\/13.10.18"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2817047"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1167\/8.14.18"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.620"},{"key":"ref76","article-title":"Eml-net: An expandable multi-layer network for saliency prediction","author":"jia","year":"2018","journal-title":"arXiv 1805 01047"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1016\/j.visres.2014.11.006"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2017.2787612"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2017.03.018"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2005.12.126"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1167\/11.4.14"},{"key":"ref134","article-title":"The effect of distortions on the prediction of visual attention","author":"gide","year":"2016","journal-title":"arXiv 1604 03882"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.1007\/s12559-010-9089-5"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2851672"},{"key":"ref132","article-title":"Crowdsourcing gaze data collection","author":"rudoy","year":"2012","journal-title":"arXiv 1204 3367"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.62"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01231-1_15"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1167\/13.4.5"},{"key":"ref138","article-title":"Adversarial attacks against deep saliency models","author":"che","year":"2019","journal-title":"arXiv 1904 01231"},{"key":"ref137","article-title":"Invariance analysis of saliency models versus human gaze during scene free viewing","author":"che","year":"2018","journal-title":"arXiv preprint arXiv 1810 10053"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/5.726791"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.97"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.358"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref63","article-title":"Deep gaze i: Boosting saliency prediction with feature maps trained on imagenet","author":"k\u00fcmmerer","year":"2014","journal-title":"arXiv 1411 1045"},{"key":"ref64","first-page":"1097","article-title":"Imagenet classification with deep convolutional neural networks","volume":"1","author":"krizhevsky","year":"2012","journal-title":"Proc 25th Int Conf Neural Inf Process Syst"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.387"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.513"},{"key":"ref141","article-title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","author":"soomro","year":"2012","journal-title":"arXiv 1212 0402"},{"key":"ref66","first-page":"362","article-title":"Predicting eye fixations using convolutional neural networks","author":"liu","year":"2015","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995586"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2017.2710620"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6248010"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2016.7900174"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00772"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1016\/0010-0285(80)90005-5"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.71"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.101"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/978-94-009-3833-5_5"},{"key":"ref109","first-page":"2188","article-title":"Saliency, scale and information: Towards a unifying theory","author":"rahman","year":"2015","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00783"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1167\/18.6.10"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.188"},{"key":"ref107","first-page":"199","article-title":"Where are they looking?","author":"recasens","year":"2015","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref93","article-title":"Predicting video saliency with object-to-motion cnn and two-layer convolutional lstm","author":"jiang","year":"2017","journal-title":"arXiv 1709 06316"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2017.2754941"},{"key":"ref92","article-title":"Recurrent mixture density network for spatiotemporal visual attention","author":"bazzani","year":"2017","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.623"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP.2016.7532629"},{"key":"ref104","first-page":"3823","article-title":"Variational laws of visual attention for dynamic scenes","author":"zanca","year":"2017","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2017.2777665"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01270-0_47"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1167\/7.14.4"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1038\/35058500"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1167\/14.13.3"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1038\/s41562-017-0058"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2009.5459462"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6247706"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2018.2832053"},{"key":"ref97","article-title":"Salient object detection in the deep learning era: An in-depth survey","author":"wang","year":"2019","journal-title":"arXiv 1904 09146"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1016\/j.visres.2015.01.010"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2815601"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.673"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.118"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1167\/14.3.14"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1016\/j.visres.2015.04.007"},{"key":"ref118","article-title":"Labeled faces in the wild: A database for studying face recognition in unconstrained environments","author":"huang","year":"2007"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.38"},{"key":"ref82","first-page":"274","article-title":"An integrated model for effective saliency prediction","author":"sun","year":"2017","journal-title":"Proc 31st AAAI Conf Artif Intell"},{"key":"ref117","first-page":"1","article-title":"Cat2000: A large scale fixation dataset for boosting saliency research","author":"borji","year":"2015","journal-title":"arXiv 1505 03581"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-33709-3_30"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.370"},{"key":"ref18","article-title":"Understanding neural networks through deep visualization","author":"yosinski","year":"2015","journal-title":"arXiv preprint arXiv 1506 06579"},{"key":"ref84","first-page":"3174","article-title":"Fixation bank: Learning to reweight fixation candidates","author":"zhao","year":"2015","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref119","doi-asserted-by":"publisher","DOI":"10.1109\/IROS.2010.5649430"},{"key":"ref19","article-title":"TurkerGaze: Crowdsourcing saliency with webcam based eye tracking","volume":"abs 1504 6755","author":"xu","year":"2015"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2834826"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1167\/10.8.20"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1167\/16.14.18"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.1167\/9.12.10"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.119"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2015.2480683"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1016\/j.cognition.2010.09.003"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1145\/2502081.2502128"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1167\/16.1.18"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1167\/14.13.3"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-010-0376-0"},{"key":"ref85","article-title":"Deepfeat: A bottom-up and top-down saliency model based on deep features of convolutional neural nets","author":"mahdi","year":"2019","journal-title":"IEEE Trans Cogn Develop Syst"},{"key":"ref86","article-title":"Personalized saliency and its prediction","author":"xu","year":"2017","journal-title":"arXiv 1710 03011"},{"key":"ref87","article-title":"PathGAN: Visual scanpath prediction with generative adversarial networks","author":"assens","year":"2018","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00336"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/9317867\/08805409.pdf?arnumber=8805409","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,10]],"date-time":"2022-05-10T14:49:20Z","timestamp":1652194160000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8805409\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,2,1]]},"references-count":157,"journal-issue":{"issue":"2"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2019.2935715","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,2,1]]}}}