{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:28:55Z","timestamp":1740122935129,"version":"3.37.3"},"reference-count":59,"publisher":"Springer Science and Business Media LLC","issue":"31-32","license":[{"start":{"date-parts":[[2020,6,5]],"date-time":"2020-06-05T00:00:00Z","timestamp":1591315200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,6,5]],"date-time":"2020-06-05T00:00:00Z","timestamp":1591315200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2020,8]]},"DOI":"10.1007\/s11042-020-09020-3","type":"journal-article","created":{"date-parts":[[2020,6,5]],"date-time":"2020-06-05T11:04:14Z","timestamp":1591355054000},"page":"23045-23069","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["A model of co-saliency based audio attention"],"prefix":"10.1007","volume":"79","author":[{"given":"XiaoMing","family":"Zhao","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4858-0705","authenticated-orcid":false,"given":"Xinxin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"De","family":"Cheng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,6,5]]},"reference":[{"key":"9020_CR1","doi-asserted-by":"crossref","unstructured":"Achanta R, Hemami S, Estrada F, et al. (2009) Frequency-tuned salient region detection[C]. In: 2009 IEEE conference on computer vision and pattern recognition, IEEE","DOI":"10.1109\/CVPRW.2009.5206596"},{"key":"9020_CR2","doi-asserted-by":"crossref","unstructured":"Achanta S, Hemami S, Estrada FJ, Ssstrunk S (2009) Frequency-tuned salient region detection. IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR)","DOI":"10.1109\/CVPRW.2009.5206596"},{"key":"9020_CR3","doi-asserted-by":"crossref","unstructured":"Badshah AM, Ahmad J, Rahim N, et al. (2017) Speech emotion recognition from spectrograms with deep convolutional neural network[C]. International conference on platform technology and service, IEEE","DOI":"10.1109\/PlatCon.2017.7883728"},{"key":"9020_CR4","doi-asserted-by":"crossref","unstructured":"Badshah AM, Rahim N, Ullah N, et al. (2017) Deep features-based speech emotion recognition for smart affective services[J]. Multimed Tools Appl","DOI":"10.1007\/s11042-017-5292-7"},{"key":"9020_CR5","unstructured":"Cano P, Batlle E, Kalker T, et al. (2002) A review of algorithms for audio fingerprinting[m]. A review of algorithms for audio fingerprinting"},{"key":"9020_CR6","doi-asserted-by":"crossref","unstructured":"Cao X, Cheng Y, Tao Z, et al. (2014) Co-saliency detection via base reconstruction[C]. ACM International conference on multimedia, ACM","DOI":"10.1145\/2647868.2655007"},{"key":"9020_CR7","doi-asserted-by":"crossref","unstructured":"Chang KY, Liu TL, Lai SH (2011) From co-saliency to co-segmentation: An efficient and fully unsupervised energy minimization model[C]. The 24th IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2011, Colorado Springs, CO, USA, 20-25 June 2011","DOI":"10.1109\/CVPR.2011.5995415"},{"key":"9020_CR8","doi-asserted-by":"crossref","unstructured":"Chen M, Cheng G, Guo L (2017) Identifying affective levels on music video via completing the missing modality[J]. Multimedia Tools and Applications","DOI":"10.1007\/s11042-017-5125-8"},{"key":"9020_CR9","doi-asserted-by":"crossref","unstructured":"Cheng MM, Zhang GX, Mitra NJ, et al. (2011) Global contrast based salient region detection[C]. 2011 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), IEEE","DOI":"10.1109\/CVPR.2011.5995344"},{"key":"9020_CR10","unstructured":"Cooke M (1993) Modelling Auditory Processing and Organisation[M]. Modelling auditory processing and organisation. Cambridge University Press"},{"issue":"2","key":"9020_CR11","doi-asserted-by":"crossref","first-page":"2353","DOI":"10.1007\/s11042-015-3210-4","volume":"76","author":"K Darabi","year":"2017","unstructured":"Darabi K, Ghinea G (2017) User-centred personalised video abstraction approach adopting SIFT features[J]. Multimedia Tools and Applications 76(2):2353\u20132378","journal-title":"Multimedia Tools and Applications"},{"key":"9020_CR12","unstructured":"Duangudom V, Anderson DV (2015) Using auditory saliency to understand complex auditory scenes[C]. European signal processing conference"},{"issue":"10","key":"9020_CR13","doi-asserted-by":"crossref","first-page":"3766","DOI":"10.1109\/TIP.2013.2260166","volume":"22","author":"H Fu","year":"2013","unstructured":"Fu H, Cao X, Tu Z (2013) Cluster-based co-saliency detection[J]. IEEE Trans Image Process 22(10):3766\u20133778","journal-title":"IEEE Trans Image Process"},{"issue":"11","key":"9020_CR14","doi-asserted-by":"crossref","first-page":"3415","DOI":"10.1109\/TIP.2015.2442915","volume":"24","author":"H Fu","year":"2015","unstructured":"Fu H, Xu D, Zhang B, et al. (2015) Object-based multiple foreground video co-segmentation via multi-state selection graph[J]. IEEE Trans Image Process 24 (11):3415\u20133424","journal-title":"IEEE Trans Image Process"},{"key":"9020_CR15","unstructured":"Gao D, Guo A, Zhao D, et al. (2007) The discriminant center-surround hypothesis for bottom-up saliency[C]. International conference on neural information processing systems, Curran Associates Inc"},{"key":"9020_CR16","doi-asserted-by":"crossref","first-page":"69","DOI":"10.1016\/j.image.2016.03.005","volume":"44","author":"C Ge","year":"2016","unstructured":"Ge C, Fu K, Liu F, et al. (2016) Co-saliency detection via inter and intra saliency propagation[J]. Signal Process Image Commun 44:69\u201383","journal-title":"Signal Process Image Commun"},{"key":"9020_CR17","unstructured":"Han J, Cheng G, Li Z, et al. (2017) A unified metric learning-based framework for co-saliency detection[J]. IEEE Trans Circuits Sys Vid Technol, pp 1\u20131"},{"issue":"1","key":"9020_CR18","doi-asserted-by":"crossref","first-page":"84","DOI":"10.1109\/MSP.2017.2749125","volume":"35","author":"J Han","year":"2018","unstructured":"Han J, Zhang D, Cheng G, et al. (2018) Advanced deep-learning techniques for salient and category-specific object detection: A survey[J]. IEEE Signal Process Mag 35(1):84\u2013100","journal-title":"IEEE Signal Process Mag"},{"key":"9020_CR19","doi-asserted-by":"crossref","unstructured":"Hou X, Zhang L (2007) Saliency detection: A spectral residual approach[C]. IEEE conference on computer vision pattern recognition","DOI":"10.1109\/CVPR.2007.383267"},{"key":"9020_CR20","unstructured":"Hou X, Zhang L (2009) Saliency detection: a spectral residual approach. IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR)"},{"key":"9020_CR21","doi-asserted-by":"crossref","unstructured":"Hsu KJ, Tsai CC, et al. (2018) Unsupervised CNN-based co-saliency detection with graphical optimization[J]. Multimed Tools Applications, pp 502\u2013518","DOI":"10.1007\/978-3-030-01228-1_30"},{"issue":"3","key":"9020_CR22","first-page":"2017","volume":"141","author":"N Huang","year":"2163","unstructured":"Huang N, Elhilali M (2163) Auditory salience using natural soundscapes.[J]. Journal of the Acoustical Society of America 141(3):2017","journal-title":"Journal of the Acoustical Society of America"},{"issue":"5","key":"9020_CR23","doi-asserted-by":"crossref","first-page":"6785","DOI":"10.1007\/s11042-016-3354-x","volume":"76","author":"Z Huang","year":"2017","unstructured":"Huang Z, Xue W, Mao Q, et al. (2017) Unsupervised domain adaptation for speech emotion recognition using PCANet[J]. Multimed Tools Appl 76(5):6785\u20136799","journal-title":"Multimed Tools Appl"},{"issue":"3","key":"9020_CR24","doi-asserted-by":"crossref","first-page":"194","DOI":"10.1038\/35058500","volume":"2","author":"L Itti","year":"2001","unstructured":"Itti L, Koch C (2001) Computational modelling of visual attention[J]. Nat Rev Neuroscience 2(3):194\u2013203","journal-title":"Nat Rev Neuroscience"},{"key":"9020_CR25","doi-asserted-by":"crossref","unstructured":"Itti L, Koch C, Niebur E (1998) A model of saliency-based visual attention for rapid scene analysis[J]","DOI":"10.1109\/34.730558"},{"key":"9020_CR26","doi-asserted-by":"crossref","unstructured":"Jacobs DE, Dan BG, Shechtman E (2010) Cosaliency: Where people look when comparing images[C]. Acm symposium on user interface software technology","DOI":"10.1145\/1866029.1866066"},{"key":"9020_CR27","doi-asserted-by":"crossref","unstructured":"Kalinli O, Narayanan SS (2007) A saliency-based auditory attention model with applications to unsupervised prominent syllable detection in speech[J]. Interspeech","DOI":"10.21437\/Interspeech.2007-44"},{"key":"9020_CR28","doi-asserted-by":"crossref","unstructured":"Kaya EM, Elhilali M (2012) A temporal saliency map for modeling auditory attention[C]. Information sciences systems","DOI":"10.1109\/CISS.2012.6310945"},{"issue":"21","key":"9020_CR29","doi-asserted-by":"crossref","first-page":"1943","DOI":"10.1016\/j.cub.2005.09.040","volume":"15","author":"C Kayser","year":"2005","unstructured":"Kayser C, Petkov CI, Lippert M, et al. (2005) Mechanisms for allocating auditory attention: An auditory saliency map[J]. Curr Biol 15(21):1943\u20131947","journal-title":"Curr Biol"},{"issue":"1","key":"9020_CR30","doi-asserted-by":"crossref","first-page":"78","DOI":"10.1016\/j.patrec.2013.11.010","volume":"38","author":"K Kim","year":"2014","unstructured":"Kim K, Lin KH, Walther DB, et al. (2014) Automatic detection of auditory salience with optimized linear filters derived from human annotation[J]. Pattern Recogn Lett 38(1):78\u201385","journal-title":"Pattern Recogn Lett"},{"issue":"3","key":"9020_CR31","first-page":"416","volume":"8","author":"M Kleinschmidt","year":"2002","unstructured":"Kleinschmidt M (2002) Methods for capturing spectro-temporal modulations in automatic speech recognition[J]. Acta Acustica United with Acustica 8(3):416\u2013422(7)","journal-title":"Acta Acustica United with Acustica"},{"key":"9020_CR32","doi-asserted-by":"crossref","unstructured":"Kumar K, Singh R, Raj B, et al. (2011) Gammatone sub-band magnitude-domain dereverberation for ASR[C]. IEEE international conference on acoustics, IEEE","DOI":"10.1109\/ICASSP.2011.5947380"},{"key":"9020_CR33","doi-asserted-by":"crossref","unstructured":"Lang C, Nguyen TV, Katti H, et al. (2012) Depth matters: Influence of depth cues on visual saliency[C]. ECCV (2), Springer","DOI":"10.1007\/978-3-642-33709-3_8"},{"issue":"4","key":"9020_CR34","doi-asserted-by":"crossref","first-page":"375","DOI":"10.1038\/7286","volume":"2","author":"DK Lee","year":"1999","unstructured":"Lee DK, Itti L, Koch C, et al. (1999) Attention activates winner-take-all competition among visual filters[J]. Nat Neurosci 2(4):375\u2013381","journal-title":"Nat Neurosci"},{"issue":"12","key":"9020_CR35","doi-asserted-by":"crossref","first-page":"3365","DOI":"10.1109\/TIP.2011.2156803","volume":"20","author":"H Li","year":"2011","unstructured":"Li H, Ngan KN (2011) A co-saliency model of image pairs[J]. IEEE Trans Image Process 20(12):3365\u20133375","journal-title":"IEEE Trans Image Process"},{"issue":"12","key":"9020_CR36","doi-asserted-by":"crossref","first-page":"3365","DOI":"10.1109\/TIP.2011.2156803","volume":"20","author":"H Li","year":"2011","unstructured":"Li H, Ngan KN (2011) A co-saliency model of map pairs[J]. IEEE Transactions on map Processing 20(12):3365\u20133375","journal-title":"IEEE Transactions on map Processing"},{"issue":"5","key":"9020_CR37","doi-asserted-by":"crossref","first-page":"588","DOI":"10.1109\/LSP.2014.2364896","volume":"22","author":"Y Li","year":"2015","unstructured":"Li Y, Fu K, Liu Z, et al. (2015) Efficient saliency-model-guided visual co-saliency detection[J]. IEEE Signal Process Lett 22(5):588\u2013592","journal-title":"IEEE Signal Process Lett"},{"key":"9020_CR38","doi-asserted-by":"crossref","unstructured":"Liu T, Sun J, Zheng NN, et al. (2007) Learning to detect a salient object[C]. IEEE conference on computer vision pattern recognition, IEEE","DOI":"10.1109\/CVPR.2007.383047"},{"issue":"1","key":"9020_CR39","doi-asserted-by":"crossref","first-page":"171","DOI":"10.1109\/TPAMI.2009.112","volume":"32","author":"V Mahadevan","year":"2009","unstructured":"Mahadevan V, Vasconcelos N (2009) Spatiotemporal saliency in dynamic scenes[J]. IEEE Trans Pattern Anal Mach Intell 32(1):171\u2013177","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"2","key":"9020_CR40","doi-asserted-by":"crossref","first-page":"205","DOI":"10.1016\/j.visres.2004.07.042","volume":"45","author":"V Navalpakkam","year":"2005","unstructured":"Navalpakkam V, Itti L (2005) Modeling the influence of task on attention[J]. Vision Res 45(2):205\u2013231","journal-title":"Vision Res"},{"key":"9020_CR41","doi-asserted-by":"crossref","unstructured":"Petit C, El-Amraoui A, Avan P (2016) Audition: Hearing and deafness[M]","DOI":"10.1007\/978-1-4939-3474-4_26"},{"key":"9020_CR42","unstructured":"Platt J, Hofmann T, et al. (2006) Graph-based visual saliency[C]. International conference on neural information processing systems"},{"key":"9020_CR43","unstructured":"Radhakrishna A, Sheila H, Francisco E, et al. (2009) Frequency-tuned salient region detection[C]. In: 2009 IEEE conference on computer vision and pattern recognition, IEEE"},{"key":"9020_CR44","doi-asserted-by":"crossref","first-page":"765","DOI":"10.1007\/s11042-019-08192-x","volume":"79","author":"R Sarkar","year":"2020","unstructured":"Sarkar R, Choudhury S, Dutta S, et al. (2020) Recognition of emotion in music based on deep convolutional neural network[J]. Multimed Tools Applications 79:765\u2013783","journal-title":"Multimed Tools Applications"},{"issue":"1","key":"9020_CR45","doi-asserted-by":"crossref","first-page":"501","DOI":"10.1146\/annurev.neuro.23.1.501","volume":"23","author":"CE Schreiner","year":"2000","unstructured":"Schreiner CE, Read HL, Sutter ML (2000) Modular organization of frequency integration in primary auditory cortex.[J]. Annu Rev Neurosci 23(1):501\u2013529","journal-title":"Annu Rev Neurosci"},{"key":"9020_CR46","unstructured":"Tao XU, Songmin J, Guoliang Z (2017) Fast spatial object location method for service robot based on co-saliency[j]. Robot"},{"issue":"1","key":"9020_CR47","doi-asserted-by":"crossref","first-page":"97","DOI":"10.1016\/0010-0285(80)90005-5","volume":"12","author":"AM Treisman","year":"1980","unstructured":"Treisman AM, Gelade G, Gelade G (1980) A feature integration theory of attention. Cog Psychol 12(1):97\u2013136","journal-title":"Cog Psychol"},{"issue":"1","key":"9020_CR48","doi-asserted-by":"crossref","first-page":"608","DOI":"10.1016\/j.sigpro.2013.07.029","volume":"94","author":"A Venkitaraman","year":"2014","unstructured":"Venkitaraman A, Adiga A, Seelamantula CS (2014) Auditory-motivated Gammatone wavelet transform[J]. Signal Process 94(1):608\u2013619","journal-title":"Signal Process"},{"key":"9020_CR49","doi-asserted-by":"crossref","unstructured":"Wang J, Zhang K, Madani K, et al. (2014) A visualized acoustic saliency feature extraction method for environment sound signal processing[C]. Tencon IEEE Region 10 Conference, IEEE","DOI":"10.1109\/TENCON.2013.6718918"},{"key":"9020_CR50","doi-asserted-by":"crossref","first-page":"444","DOI":"10.1016\/j.neucom.2014.09.046","volume":"152","author":"J Wang","year":"2015","unstructured":"Wang J, Zhang K, Madani K, et al. (2015) Salient environmental sound detection framework for machine awareness[J]. Neurocomputing 152:444\u2013454","journal-title":"Neurocomputing"},{"key":"9020_CR51","doi-asserted-by":"crossref","unstructured":"Xie Y, Liu Z, Zhou X, et al. (2019) Video co-segmentation based on directed graph[J]. Multimedia Tools and Applications","DOI":"10.1007\/s11042-018-6614-0"},{"issue":"5","key":"9020_CR52","doi-asserted-by":"crossref","first-page":"707","DOI":"10.1016\/j.specom.2010.04.008","volume":"53","author":"H Yin","year":"2011","unstructured":"Yin H, Hohmann V, Nadeu C (2011) Acoustic features for speech recognition based on Gammatone filterbank and instantaneous frequency[J]. Speech Comm 53 (5):707\u2013715","journal-title":"Speech Comm"},{"key":"9020_CR53","doi-asserted-by":"crossref","unstructured":"Zhai Y, Shah M (2006) Visual attention detection in video sequences using spatiotemporal cues[C]. Proceedings of the 14th ACM International Conference on Multimedia, Santa Barbara, CA, USA, October 23\u201327, 2006 ACM","DOI":"10.1145\/1180639.1180824"},{"key":"9020_CR54","unstructured":"Zhang D, Fu H, Han J, et al. (2016) A review of co-saliency detection technique: Fundamentals, applications, and challenges[J]"},{"issue":"6","key":"9020_CR55","first-page":"1","volume":"27","author":"D Zhang","year":"2015","unstructured":"Zhang D, Han J, Han J, et al. (2015) Cosaliency detection based on intrasaliency prior transfer and deep intersaliency mining[J]. IEEE Trans Neural Netw Learning Sys 27(6):1\u201314","journal-title":"IEEE Trans Neural Netw Learning Sys"},{"issue":"2","key":"9020_CR56","doi-asserted-by":"crossref","first-page":"215","DOI":"10.1007\/s11263-016-0907-4","volume":"120","author":"D Zhang","year":"2016","unstructured":"Zhang D, Han J, Li C, et al. (2016) Detection of co-salient objects by looking deep and wide[j]. Int J Comput Vis 120(2):215\u2013232","journal-title":"Int J Comput Vis"},{"key":"9020_CR57","doi-asserted-by":"crossref","unstructured":"Zhang D, Meng D, Han J (2017) Co-saliency detection via a self-paced multiple-instance learning framework[J]. IEEE transactions on pattern analysis and machine intelligence","DOI":"10.1109\/TPAMI.2016.2567393"},{"key":"9020_CR58","doi-asserted-by":"crossref","first-page":"17825","DOI":"10.1007\/s11042-019-7180-9","volume":"78","author":"Q-Y Zhang","year":"2019","unstructured":"Zhang Q-Y, Zhou L, Zhang T, et al. (2019) A retrieval algorithm of encrypted speech based on short-term cross-correlation and perceptual hashing[J]. Multimedia Tools and Applications 78:17825\u201317846","journal-title":"Multimedia Tools and Applications"},{"issue":"2","key":"9020_CR59","first-page":"206","volume":"31","author":"Y Zhang","year":"2013","unstructured":"Zhang Y, Han J, Guo L, et al. (2013) A new algorithm for detecting co-saliency in multiple images through sparse coding representation[J]. Xibei Gongye Daxue Xuebao\/Journal of Northwestern Polytechnical University 31(2):206\u2013209","journal-title":"Xibei Gongye Daxue Xuebao\/Journal of Northwestern Polytechnical University"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09020-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-020-09020-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09020-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,10,26]],"date-time":"2022-10-26T20:03:48Z","timestamp":1666814628000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-020-09020-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,6,5]]},"references-count":59,"journal-issue":{"issue":"31-32","published-print":{"date-parts":[[2020,8]]}},"alternative-id":["9020"],"URL":"https:\/\/doi.org\/10.1007\/s11042-020-09020-3","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"type":"print","value":"1380-7501"},{"type":"electronic","value":"1573-7721"}],"subject":[],"published":{"date-parts":[[2020,6,5]]},"assertion":[{"value":"7 May 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 February 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 May 2020","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 June 2020","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}