{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T01:56:03Z","timestamp":1784598963378,"version":"3.55.0"},"publisher-location":"Cham","reference-count":37,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031781858","type":"print"},{"value":"9783031781865","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,30]],"date-time":"2024-11-30T00:00:00Z","timestamp":1732924800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,30]],"date-time":"2024-11-30T00:00:00Z","timestamp":1732924800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-78186-5_2","type":"book-chapter","created":{"date-parts":[[2024,11,29]],"date-time":"2024-11-29T14:18:02Z","timestamp":1732889882000},"page":"15-31","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["TDiffSal: Text-Guided Diffusion Saliency Prediction Model for\u00a0Images"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9843-5269","authenticated-orcid":false,"given":"Nana","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-9393-8975","authenticated-orcid":false,"given":"Min","family":"Xiong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6436-7088","authenticated-orcid":false,"given":"Dandan","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5773-5089","authenticated-orcid":false,"given":"Kun","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5693-0416","authenticated-orcid":false,"given":"Guangtao","family":"Zhai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,11,30]]},"reference":[{"key":"2_CR1","doi-asserted-by":"crossref","unstructured":"Chai, W., Guo, X., Wang, G., Lu, Y.: Stablevideo: text-driven consistency-aware diffusion video editing. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 23040\u201323050 (2023)","DOI":"10.1109\/ICCV51070.2023.02106"},{"key":"2_CR2","doi-asserted-by":"publisher","first-page":"2287","DOI":"10.1109\/TIP.2019.2945857","volume":"29","author":"Z Che","year":"2020","unstructured":"Che, Z., Borji, A., Zhai, G., Min, X., Guo, G., Le Callet, P.: How is gaze influenced by image transformations? dataset and model. IEEE Trans. Image Process. 29, 2287\u20132300 (2020). https:\/\/doi.org\/10.1109\/TIP.2019.2945857","journal-title":"IEEE Trans. Image Process."},{"key":"2_CR3","doi-asserted-by":"crossref","unstructured":"Chen, S., Sun, P., Song, Y., Luo, P.: Diffusiondet: diffusion model for object detection. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 19830\u201319843 (October 2023)","DOI":"10.1109\/ICCV51070.2023.01816"},{"issue":"10","key":"2_CR4","doi-asserted-by":"publisher","first-page":"5142","DOI":"10.1109\/TIP.2018.2851672","volume":"27","author":"M Cornia","year":"2018","unstructured":"Cornia, M., Baraldi, L., Serra, G., Cucchiara, R.: Predicting human eye fixations via an LSTM-based saliency attentive model. IEEE Trans. Image Process. 27(10), 5142\u20135154 (2018). https:\/\/doi.org\/10.1109\/TIP.2018.2851672","journal-title":"IEEE Trans. Image Process."},{"key":"2_CR5","doi-asserted-by":"crossref","unstructured":"Coutrot, A., Guyader, N.: Toward the introduction of auditory information in dynamic visual attention models. 2013 14th International Workshop on Image Analysis for Multimedia Interactive Services (WIAMIS), pp.\u00a01\u20134 (2013)","DOI":"10.1109\/WIAMIS.2013.6616164"},{"key":"2_CR6","doi-asserted-by":"crossref","unstructured":"Coutrot, A., Guyader, N.: How saliency, faces, and sound influence gaze in dynamic social scenes. J. Vision 14 8, 5 (2014)","DOI":"10.1167\/14.8.5"},{"key":"2_CR7","doi-asserted-by":"publisher","unstructured":"Farazi, M., Khan, S., Barnes, N.: Question-agnostic attention for visual question answering. In: 2020 25th International Conference on Pattern Recognition (ICPR), pp. 3542\u20133549 (2021). https:\/\/doi.org\/10.1109\/ICPR48806.2021.9413330","DOI":"10.1109\/ICPR48806.2021.9413330"},{"key":"2_CR8","doi-asserted-by":"publisher","unstructured":"Fosco, C., Newman, A., Sukhum, P., Zhang, Y.B., Zhao, N., Oliva, A., Bylinskii, Z.: How much time do you have? Modeling multi-duration saliency. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4472\u20134481 (2020). https:\/\/doi.org\/10.1109\/CVPR42600.2020.00453","DOI":"10.1109\/CVPR42600.2020.00453"},{"key":"2_CR9","doi-asserted-by":"publisher","unstructured":"Ghandi, T., Pourreza, H., Mahyar, H.: Deep learning approaches on image captioning: a review. ACM Comput. Surv. 56(3) (2023). https:\/\/doi.org\/10.1145\/3617592","DOI":"10.1145\/3617592"},{"key":"2_CR10","unstructured":"Grauman, K., Westbury, A., Byrne, E., et al.: Ego4d: around the world in 3,000 hours of egocentric video. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 18995\u201319012 (June 2022)"},{"key":"2_CR11","first-page":"545","volume":"19","author":"J Harel","year":"2007","unstructured":"Harel, J., Koch, C., Perona, P.: Graph-based visual saliency. Adv. Neural. Inf. Process. Syst. 19, 545\u2013552 (2007)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2_CR12","doi-asserted-by":"crossref","unstructured":"Hegde, S., Jahagirdar, S., Gangisetty, S.: Making the v in text-VQA matter. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, pp. 5580\u20135588 (2023)","DOI":"10.1109\/CVPRW59228.2023.00590"},{"key":"2_CR13","unstructured":"Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. In: Proceedings of the 34th International Conference on Neural Information Processing Systems. NIPS \u201920, Red Hook, NY, USA. Curran Associates Inc. (2020)"},{"key":"2_CR14","doi-asserted-by":"publisher","unstructured":"Hou, X., Zhang, L.: Saliency detection: a spectral residual approach. In: 2007 IEEE Conference on Computer Vision and Pattern Recognition, pp.\u00a01\u20138 (2007). https:\/\/doi.org\/10.1109\/CVPR.2007.383267","DOI":"10.1109\/CVPR.2007.383267"},{"issue":"11","key":"2_CR15","doi-asserted-by":"publisher","first-page":"1254","DOI":"10.1109\/34.730558","volume":"20","author":"L Itti","year":"1998","unstructured":"Itti, L., Koch, C., Niebur, E.: A model of saliency-based visual attention for rapid scene analysis. IEEE Trans. Pattern Anal. Mach. Intell. 20(11), 1254\u20131259 (1998). https:\/\/doi.org\/10.1109\/34.730558","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2_CR16","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2020.103887","volume":"95","author":"S Jia","year":"2020","unstructured":"Jia, S., Bruce, N.D.: EML-Net: an expandable multi-layer network for saliency prediction. Image Vis. Comput. 95, 103887 (2020). https:\/\/doi.org\/10.1016\/j.imavis.2020.103887","journal-title":"Image Vis. Comput."},{"key":"2_CR17","unstructured":"Jiang, D., et al.: Comat: aligning text-to-image diffusion model with image-to-text concept matching (2024)"},{"key":"2_CR18","doi-asserted-by":"publisher","unstructured":"Jiang, M., Huang, S., Duan, J., Zhao, Q.: Salicon: saliency in context. In: 2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1072\u20131080 (2015). https:\/\/doi.org\/10.1109\/CVPR.2015.7298710","DOI":"10.1109\/CVPR.2015.7298710"},{"key":"2_CR19","doi-asserted-by":"crossref","unstructured":"Junwen\u00a0Xiong, Peng\u00a0Zhang, T.Y.C.L.W.H., Zha, Y.: DiffSal: joint audio and video learning for diffusion saliency prediction. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (2024)","DOI":"10.1109\/CVPR52733.2024.02575"},{"key":"2_CR20","unstructured":"Linardos, P., Mohedano, E., Nieto, J.J., O\u2019Connor, N.E., Gir\u00f3-i-Nieto, X., McGuinness, K.: Simple vs complex temporal recurrences for video saliency prediction. In: 30th British Machine Vision Conference 2019, BMVC 2019, Cardiff, UK, September 9-12, 2019. p.\u00a0182. BMVA Press (2019), https:\/\/bmvc2019.org\/wp-content\/uploads\/papers\/0952-paper.pdf"},{"key":"2_CR21","doi-asserted-by":"publisher","first-page":"5244","DOI":"10.1109\/TIP.2020.2979010","volume":"29","author":"J Liu","year":"2020","unstructured":"Liu, J., Wang, W., Wang, L., Yang, M.H.: Attribute-guided attention for referring expression generation and comprehension. IEEE Trans. Image Process. 29, 5244\u20135258 (2020). https:\/\/doi.org\/10.1109\/TIP.2020.2979010","journal-title":"IEEE Trans. Image Process."},{"key":"2_CR22","doi-asserted-by":"publisher","first-page":"455","DOI":"10.1016\/j.neucom.2022.04.080","volume":"494","author":"J Lou","year":"2022","unstructured":"Lou, J., Lin, H., Marshall, D., Saupe, D., Liu, H.: Transalnet: towards perceptually relevant visual saliency prediction. Neurocomputing 494, 455\u2013467 (2022). https:\/\/doi.org\/10.1016\/j.neucom.2022.04.080. https:\/\/www.sciencedirect.com\/science\/article\/pii\/S0925231222004714","journal-title":"Neurocomputing"},{"key":"2_CR23","doi-asserted-by":"crossref","unstructured":"Mensink, T., et al.: Encyclopedic VQA: visual questions about detailed properties of fine-grained categories. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 3113\u20133124 (2023)","DOI":"10.1109\/ICCV51070.2023.00289"},{"key":"2_CR24","doi-asserted-by":"crossref","unstructured":"Pan, J., Sayrol, E., Giro-i Nieto, X., McGuinness, K., O\u2019Connor, N.E.: Shallow and deep convolutional networks for saliency prediction. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 598\u2013606 (2016)","DOI":"10.1109\/CVPR.2016.71"},{"key":"2_CR25","doi-asserted-by":"publisher","unstructured":"Pei, J., Zhou, T., Tang, H., Liu, C., Chen, C.: FGO-net: feature and gaussian optimization network for visual saliency prediction. Appl. Intell. 53(6), 6214\u20136229 (2022). https:\/\/doi.org\/10.1007\/s10489-022-03647-5","DOI":"10.1007\/s10489-022-03647-5"},{"key":"2_CR26","unstructured":"Radford, A., et al.: Learning transferable visual models from natural language supervision. In: Meila, M., Zhang, T. (eds.) Proceedings of the 38th International Conference on Machine Learning. Proceedings of Machine Learning Research, vol.\u00a0139, pp. 8748\u20138763. PMLR (2021)"},{"key":"2_CR27","unstructured":"Ramesh, A., Dhariwal, P., Nichol, A., Chu, C., Chen, M.: Hierarchical text-conditional image generation with clip latents. ArXiv abs\/2204.06125 (2022). https:\/\/api.semanticscholar.org\/CorpusID:248097655"},{"key":"2_CR28","doi-asserted-by":"publisher","unstructured":"Reddy, N., Jain, S., Yarlagadda, P., Gandhi, V.: Tidying deep saliency prediction architectures. In: 2020 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS), pp. 10241\u201310247 (2020). https:\/\/doi.org\/10.1109\/IROS45743.2020.9341574","DOI":"10.1109\/IROS45743.2020.9341574"},{"key":"2_CR29","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image synthesis with latent diffusion models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 10684\u201310695 (2022)","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"2_CR30","doi-asserted-by":"publisher","unstructured":"Saharia, C., et al.: Palette: Image-to-image diffusion models. In: ACM SIGGRAPH 2022 Conference Proceedings. SIGGRAPH \u201922, New York, NY, USA. Association for Computing Machinery (2022). https:\/\/doi.org\/10.1145\/3528233.3530757, https:\/\/doi.org\/10.1145\/3528233.3530757","DOI":"10.1145\/3528233.3530757"},{"key":"2_CR31","unstructured":"Shi, S., Zhang, L., Chen, J.: Hyperspectral and multispectral image fusion using the conditional denoising diffusion probabilistic model. arXiv:abs\/2307.03423 (2023). https:\/\/api.semanticscholar.org\/CorpusID:259375862"},{"key":"2_CR32","doi-asserted-by":"publisher","unstructured":"Sun, Y., Min, X., Duan, H., Zhai, G.: The influence of text-guidance on visual attention. In: 2023 IEEE International Symposium on Circuits and Systems (ISCAS), pp.\u00a01\u20135 (2023). https:\/\/doi.org\/10.1109\/ISCAS46773.2023.10182000","DOI":"10.1109\/ISCAS46773.2023.10182000"},{"key":"2_CR33","doi-asserted-by":"crossref","unstructured":"Tsiami, A., Koutras, P., Maragos, P.: Stavis: spatio-temporal audiovisual saliency network. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4766\u20134776 (2020)","DOI":"10.1109\/CVPR42600.2020.00482"},{"key":"2_CR34","doi-asserted-by":"crossref","unstructured":"Xie, C., Xia, C., Ma, M., Zhao, Z., Chen, X., Li, J.: Pyramid grafting network for one-stage high resolution saliency detection. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 11717\u201311726 (2022)","DOI":"10.1109\/CVPR52688.2022.01142"},{"key":"2_CR35","doi-asserted-by":"crossref","unstructured":"Yang, R., Srivastava, P., Mandt, S.: Diffusion probabilistic modeling for video generation. Entropy 25 (2022). https:\/\/api.semanticscholar.org\/CorpusID:247519223","DOI":"10.3390\/e25101469"},{"key":"2_CR36","doi-asserted-by":"crossref","unstructured":"Yang, Y., Mandt, S.: Computationally-efficient neural image compression with shallow decoders. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 530\u2013540 (2023)","DOI":"10.1109\/ICCV51070.2023.00055"},{"key":"2_CR37","doi-asserted-by":"publisher","unstructured":"Yu, L., Tan, H., Bansal, M., Berg, T.L.: A joint speaker-listener-reinforcer model for referring expressions. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3521\u20133529 (2017). https:\/\/doi.org\/10.1109\/CVPR.2017.375","DOI":"10.1109\/CVPR.2017.375"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-78186-5_2","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,29]],"date-time":"2024-11-29T15:10:30Z","timestamp":1732893030000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-78186-5_2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,30]]},"ISBN":["9783031781858","9783031781865"],"references-count":37,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-78186-5_2","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,30]]},"assertion":[{"value":"30 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Kolkata","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"India","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"1 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"5 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icpr2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/icpr2024.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}