{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,21]],"date-time":"2026-08-21T14:00:02Z","timestamp":1787320802300,"version":"build-2736575974"},"reference-count":97,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2017,8,7]],"date-time":"2017-08-07T00:00:00Z","timestamp":1502064000000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"name":"Seventh Framework Programme","award":["FP7-600796"],"award-info":[{"award-number":["FP7-600796"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Image Video Proc."],"published-print":{"date-parts":[[2017,12]]},"DOI":"10.1186\/s13640-017-0194-1","type":"journal-article","created":{"date-parts":[[2017,8,7]],"date-time":"2017-08-07T05:37:05Z","timestamp":1502084225000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":44,"title":["COGNIMUSE: a multimodal video database annotated with saliency, events, semantics and emotion with application to summarization"],"prefix":"10.1186","volume":"2017","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-1922-9310","authenticated-orcid":false,"given":"Athanasia","family":"Zlatintsi","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Petros","family":"Koutras","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Georgios","family":"Evangelopoulos","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Nikolaos","family":"Malandrakis","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Niki","family":"Efthymiou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Katerina","family":"Pastra","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Alexandros","family":"Potamianos","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Petros","family":"Maragos","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2017,8,7]]},"reference":[{"issue":"4","key":"194_CR1","first-page":"219","volume":"4","author":"C Koch","year":"1985","unstructured":"C Koch, S Ullman, Shifts in selective visual attention: towards the underlying neural circuitry. Hum. Neurobiol.4(4), 219\u2013227 (1985).","journal-title":"Hum. Neurobiol."},{"issue":"3","key":"194_CR2","doi-asserted-by":"crossref","first-page":"194","DOI":"10.1038\/35058500","volume":"2","author":"L Itti","year":"2001","unstructured":"L Itti, C Koch, Computational modelling of visual attention. Nat. Rev. Neurosci.2(3), 194\u2013203 (2001).","journal-title":"Nat. Rev. Neurosci."},{"issue":"21","key":"194_CR3","doi-asserted-by":"crossref","first-page":"1943","DOI":"10.1016\/j.cub.2005.09.040","volume":"15","author":"C Kayser","year":"2005","unstructured":"C Kayser, CI Petkov, M Lippert, NK Logothetis, Mechanisms for allocating auditory attention: an auditory saliency map. Curr. Biol.15(21), 1943\u20131947 (2005).","journal-title":"Curr. Biol."},{"key":"194_CR4","doi-asserted-by":"crossref","unstructured":"M Elhilali, J Xiang, SA Shamma, JZ Simon, Interaction between attention and bottom-up saliency mediates the representation of foreground and background in an auditory scene. PLoS Biol. 7(6) (2009).","DOI":"10.1371\/journal.pbio.1000129"},{"issue":"1","key":"194_CR5","doi-asserted-by":"crossref","first-page":"25","DOI":"10.1146\/annurev.ne.13.030190.000325","volume":"13","author":"MI Posner","year":"1990","unstructured":"MI Posner, SE Petersen, The attention system of the human brain. Ann. Rev. Neurosci.13(1), 25\u201342 (1990).","journal-title":"Ann. Rev. Neurosci."},{"key":"194_CR6","doi-asserted-by":"crossref","first-page":"57","DOI":"10.1146\/annurev.neuro.30.051606.094256","volume":"30","author":"EI Knudsen","year":"2007","unstructured":"EI Knudsen, Fundamental components of attention. Ann. Rev. Neurosci.30:, 57\u201358 (2007).","journal-title":"Ann. Rev. Neurosci."},{"issue":"9","key":"194_CR7","doi-asserted-by":"crossref","first-page":"1395","DOI":"10.1016\/j.neunet.2006.10.001","volume":"19","author":"D Walther","year":"2006","unstructured":"D Walther, C Koch, Modeling attention to salient proto-objects. J. Neural Netw.19(9), 1395\u20131407 (2006).","journal-title":"J. Neural Netw."},{"issue":"2","key":"194_CR8","doi-asserted-by":"crossref","first-page":"83","DOI":"10.1023\/A:1012460413855","volume":"45","author":"T Kadir","year":"2001","unstructured":"T Kadir, M Brady, Saliency, scale and image description. Int\u2019l. J. Comput. Vis.45(2), 83\u2013105 (2001).","journal-title":"Int\u2019l. J. Comput. Vis."},{"issue":"1","key":"194_CR9","first-page":"167","volume":"3","author":"K Rapantzikos","year":"2011","unstructured":"K Rapantzikos, Y Avrithis, S Kollias, Spatiotemporal features for action recognition and salient event detection. Cogn. Comput. Special Issue Saliency Atten Visual Search Picture Scan.3(1), 167\u2013184 (2011).","journal-title":"Cogn. Comput. Special Issue Saliency Atten Visual Search Picture Scan."},{"issue":"5","key":"194_CR10","doi-asserted-by":"crossref","first-page":"907","DOI":"10.1109\/TMM.2005.854410","volume":"7","author":"Y Ma","year":"2005","unstructured":"Y Ma, XS Hua, L Lu, H Zhang, A generic framework of user attention model and its application in video summarization. IEEE Trans. Multimedia. 7(5), 907\u2013919 (2005).","journal-title":"IEEE Trans. Multimedia"},{"issue":"2","key":"194_CR11","doi-asserted-by":"crossref","first-page":"121","DOI":"10.1016\/j.jvcir.2007.04.002","volume":"19","author":"A Money","year":"2008","unstructured":"A Money, H Agius, Video summarization: a conceptual framework and survey of the state of the art. J. Visual Commun. Image Represent.19(2), 121\u2013143 (2008).","journal-title":"J. Visual Commun. Image Represent."},{"issue":"7","key":"194_CR12","doi-asserted-by":"crossref","first-page":"1553","DOI":"10.1109\/TMM.2013.2267205","volume":"15","author":"G Evangelopoulos","year":"2013","unstructured":"G Evangelopoulos, A Zlatintsi, A Potamianos, P Maragos, K Rapantzikos, G Skoumas, Y Avrithis, Multimodal saliency and fusion for movie summarization based on aural, visual, textual attention. IEEE Trans. Multimedia. 15(7), 1553\u20131568 (2013). doi: 10.1109\/TMM.2013.2267205 .","journal-title":"IEEE Trans. Multimedia"},{"key":"194_CR13","unstructured":"K Pastra, S Piperidis, Video search: new challenges in the pervasive digital video era.J. Virtual Reality Broadcast. 3(11) (2006)."},{"key":"194_CR14","doi-asserted-by":"crossref","unstructured":"P Koutras, A Zlatintsi, E.Iosif, A Katsamanis, P Maragos, A Potamianos, in Proc. Int\u2019l Conf. on Image Process. Predicting audio-visual salient events based on visual, audio and text modalities for movie summarization (Quebec, 2015).","DOI":"10.1109\/ICIP.2015.7351630"},{"key":"194_CR15","doi-asserted-by":"crossref","unstructured":"Y Liu, F Zhou, W Liu, F De la Torre, Y Liu, in Proc. of the 18th ACM international conference on Multimedia. Unsupervised summarization of rushes videos (ACM, 2010), pp. 751\u2013754.","DOI":"10.1145\/1873951.1874069"},{"issue":"1","key":"194_CR16","doi-asserted-by":"crossref","first-page":"56","DOI":"10.1016\/j.patrec.2010.08.004","volume":"32","author":"SF de Avila","year":"2011","unstructured":"SF de Avila, AB Lopes, A da Luz Jr, A de Albuquerque Araujo, VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method. Pattern Recogn. Lett.32(1), 56\u201368 (2011).","journal-title":"Pattern Recogn. Lett."},{"key":"194_CR17","unstructured":"YJ Lee, J Ghosh, K Grauman, in Proc. Int\u2019l. Conf. Computer Vision and Pattern Recognition. Discovering important people and objects for egocentric video summarization, (2012)."},{"issue":"4","key":"194_CR18","doi-asserted-by":"crossref","first-page":"975","DOI":"10.1109\/TMM.2012.2185041","volume":"14","author":"M Wang","year":"2012","unstructured":"M Wang, R Hong, G Li, Z-J Zha, S Yan, T-S Chua, Event driven web video summarization by tag localization and key-shot identification. IEEE Trans. Multimedia. 14(4), 975\u2013985 (2012).","journal-title":"IEEE Trans. Multimedia"},{"key":"194_CR19","doi-asserted-by":"crossref","unstructured":"A Khosla, R Hamid, C-J Lin, N Sundaresan, in Proc. Int\u2019l. Conf. Computer Vision and Pattern Recognition. Large-scale video summarization using web-image priors, (2013).","DOI":"10.1109\/CVPR.2013.348"},{"key":"194_CR20","doi-asserted-by":"crossref","unstructured":"Z Lu, K Grauman, in Proc. Int\u2019l. Conf. Computer Vision and Pattern Recognition. Story-driven summarization for egocentric video, (2013).","DOI":"10.1109\/CVPR.2013.350"},{"key":"194_CR21","doi-asserted-by":"crossref","first-page":"12","DOI":"10.1109\/79.888862","volume":"17","author":"Y Wang","year":"2000","unstructured":"Y Wang, Z Liu, J-C Huang, Multimedia content analysis using both audio and visual clues. IEEE Signal Process. Mag.17:, 12\u201336 (2000).","journal-title":"IEEE Signal Process. Mag."},{"issue":"5","key":"194_CR22","doi-asserted-by":"crossref","first-page":"907","DOI":"10.1109\/TMM.2005.854410","volume":"7","author":"Y-F Ma","year":"2005","unstructured":"Y-F Ma, X-S Hua, L Lu, H-J Zhang, A generic framework of user attention model and its application in video summarization. IEEE Trans. Multimedia. 7(5), 907\u2013919 (2005).","journal-title":"IEEE Trans. Multimedia"},{"key":"194_CR23","unstructured":"D Potapov, M Douze, Z Harchaoui, C Schmid, in Proc. European Conference on Computer Vision. Category-specific video summarization, (2014). http:\/\/hal.inria.fr\/hal-01022967 ."},{"key":"194_CR24","doi-asserted-by":"crossref","unstructured":"P Over, AF Smeaton, G Awad, in Proc. 2nd ACM TRECVID Video Summarization Workshop. The Trecvid 2008 BBC rushes summarization evaluation, (2008).","DOI":"10.1145\/1463563.1463564"},{"issue":"1","key":"194_CR25","doi-asserted-by":"crossref","first-page":"3","DOI":"10.1145\/1198302.1198305","volume":"3","author":"BT Truong","year":"2007","unstructured":"BT Truong, S Venkatesh, Video abstraction: a systematic review and classification. ACM Trans. Multimedia Comput. Commun. Appl.3(1), 3 (2007).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"194_CR26","doi-asserted-by":"crossref","unstructured":"C-W Ngo, Y-F Ma, H-J Zhang, Video summarization and scene detection by graph modeling. Circuits Syst. Video Technol.15(2) (2005).","DOI":"10.1109\/TCSVT.2004.841694"},{"key":"194_CR27","unstructured":"C-Y Lin, in Proc. Text Summarization Branches, ACL Workshop. Rouge: a package for automatic evaluation of summaries (Barcelona, Spain, 2004)."},{"key":"194_CR28","doi-asserted-by":"crossref","unstructured":"G Kim, L Sigal, EP Xing, in Proc. Int\u2019l. Conf. Computer Vision and Pattern Recognition. Joint summarization of large-scale collections of web images and videos for storyline reconstruction, (2014).","DOI":"10.1109\/CVPR.2014.538"},{"key":"194_CR29","unstructured":"Y Song, J Vallmitjana, A Stent, A Jaime, in Proc. Int\u2019l. Conf. Computer Vision and Pattern Recognition. TVSum: summarizing web videos using titles, (2015)."},{"key":"194_CR30","doi-asserted-by":"crossref","unstructured":"AF Smeaton, P Over, W Kraaij, in Proc. MIR-06. Evaluation campaigns and TRECVid, (2006).","DOI":"10.1145\/1178677.1178722"},{"key":"194_CR31","doi-asserted-by":"crossref","unstructured":"M Sun, A Farhadi, S Seitz, in Proc. European Conf. on Computer Vision. Ranking domain-specific highlights by analyzing edited videos, (Springer, Cham, 2014), pp. 787\u2013802.","DOI":"10.1007\/978-3-319-10590-1_51"},{"key":"194_CR32","doi-asserted-by":"crossref","unstructured":"M Gygli, H Grabner, H Riemenschneider, LV Gool, in Proc. European Conf. on Computer Vision. Creating summaries from user videos, (Springer, Cham, 2014).","DOI":"10.1007\/978-3-319-10584-0_33"},{"key":"194_CR33","unstructured":"R Radhakrishnan, A Divakaran, P Smaragdis, in Proc. IEEE WASPAA. Audio analysis for surveillance applications, (ACM, 2005)."},{"issue":"2","key":"194_CR34","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/1352012.1352015","volume":"4","author":"M Xu","year":"2008","unstructured":"M Xu, C Xu, L Duan, JS Jin, S Luox, Audio keywords generation for sports video analysis. ACM Trans. Multimedia Comput. Commun. Appl.4(2), 1\u201323 (2008).","journal-title":"ACM Trans. Multimedia Comput. Commun. Appl."},{"key":"194_CR35","unstructured":"T Heittola, A Mesaros, A Eronen, T Virtanen, in Proc. 18th European Signal Processing Conf. Audio context recognition using audio event histograms, (ACM, 2010)."},{"key":"194_CR36","unstructured":"E Parizet, V Koehl, in Proc. Euronoise. Categorisation: a useful tool for applied perceptive studies, (2006)."},{"key":"194_CR37","unstructured":"RM Schafer, The soundscape: Our sonic environment and the tuning of the world (Simon and Schuster, 1993)."},{"issue":"6","key":"194_CR38","doi-asserted-by":"crossref","first-page":"387","DOI":"10.1016\/j.apacoust.2011.01.001","volume":"72","author":"AL Brown","year":"2011","unstructured":"AL Brown, J Kang, T Gjestland, Towards standardization in soundscape preference assessment. Appl. Acoust.72(6), 387\u2013392 (2011).","journal-title":"Appl. Acoust."},{"issue":"5","key":"194_CR39","doi-asserted-by":"crossref","first-page":"339","DOI":"10.1016\/j.cities.2005.05.003","volume":"22","author":"M Raimbault","year":"2005","unstructured":"M Raimbault, D Dubois, Urban soundscapes: experiences and knowledge. Cities. 22(5), 339\u2013350 (2005).","journal-title":"Cities"},{"key":"194_CR40","doi-asserted-by":"crossref","unstructured":"J Salamon, C Jacoby, JP Bello, in Proc. 22nd ACM Int\u2019l. Conf. on Multimedia. A dataset and taxonomy for urban sound research, (2014).","DOI":"10.1145\/2647868.2655045"},{"key":"194_CR41","unstructured":"SR Payne, WJ Davies, MD Adams, Research into the practical and policy applications of soundscape concepts and techniques in urban areas. Technical report, DEFRA, HMSO, London, UK (2009)."},{"issue":"1-3","key":"194_CR42","doi-asserted-by":"crossref","first-page":"157","DOI":"10.1007\/s11263-007-0090-8","volume":"77","author":"BC Russell","year":"2008","unstructured":"BC Russell, A Torralba, KP Murphy, WT Freeman, Labelme: a database and web-based tool for image annotation. Int\u2019l J. Comput. Vis.77(1-3), 157\u2013173 (2008).","journal-title":"Int\u2019l J. Comput. Vis."},{"key":"194_CR43","doi-asserted-by":"crossref","unstructured":"J Deng, W Dong, R Socher, L-J Li, K Li, L Fei-Fei, in Proc. IEEE Conf. Computer Vision and Pattern Recognition. Imagenet: a large-scale hierarchical image database, (2009).","DOI":"10.1109\/CVPR.2009.5206848"},{"issue":"6","key":"194_CR44","doi-asserted-by":"crossref","first-page":"976","DOI":"10.1016\/j.imavis.2009.11.014","volume":"28","author":"R Poppe","year":"2010","unstructured":"R Poppe, A survey on vision-based human action recognition. Image Vis. Comput.28(6), 976\u2013990 (2010).","journal-title":"Image Vis. Comput."},{"key":"194_CR45","doi-asserted-by":"crossref","unstructured":"S Sadanand, JJ Corso, in Proc. IEEE Conf. Computer Vision and Pattern Recognition. Action bank: a high-level representation of activity in video, (2012).","DOI":"10.1109\/CVPR.2012.6247806"},{"key":"194_CR46","doi-asserted-by":"crossref","unstructured":"M Bregonzio, S Gong, T Xiang, in Proc. IEEE Conf. Computer Vision and Pattern Recognition. Recognising action as clouds of space-time interest points, (2009).","DOI":"10.1109\/CVPRW.2009.5206779"},{"issue":"3","key":"194_CR47","doi-asserted-by":"crossref","first-page":"436","DOI":"10.1109\/TPAMI.2011.157","volume":"34","author":"Z Zhang","year":"2012","unstructured":"Z Zhang, D Tao, Slow feature analysis for human action recognition. IEEE Trans. PAMI. 34(3), 436\u2013450 (2012).","journal-title":"IEEE Trans. PAMI"},{"issue":"7","key":"194_CR48","doi-asserted-by":"crossref","first-page":"1635","DOI":"10.1109\/TPAMI.2012.253","volume":"35","author":"Y Yang","year":"2013","unstructured":"Y Yang, I Saleemi, M Shah, Discovering motion primitives for unsupervised grouping and one-shot learning of human actions, gestures, and expressions. IEEE Trans. PAMI. 35(7), 1635\u20131648 (2013).","journal-title":"IEEE Trans. PAMI"},{"key":"194_CR49","doi-asserted-by":"crossref","unstructured":"K Maninis, P Koutras, P Maragos, in Proc. Int\u2019l Conf. Image Processing. Advances on action recognition in videos using and interest point detector based on multiband spatio-temporal energies, (IEEE, 2014).","DOI":"10.1109\/ICIP.2014.7025298"},{"key":"194_CR50","doi-asserted-by":"crossref","unstructured":"A Karpathy, G Toderici, S Shetty, T Leung, R Sukthankar, L Fei-Fei, in Proc. IEEE Conf. Computer Vision and Pattern Recognition. Large-scale video classification with convolutional neural networks, (2014).","DOI":"10.1109\/CVPR.2014.223"},{"key":"194_CR51","doi-asserted-by":"crossref","unstructured":"H Wang, MM Ullah, A Kl\u00e4ser, I Laptev, C Schmid, Evaluation of local spatio-temporal features for action recognition. in Proc. BMVC. BMVC 2009-British Machine Vision Conference (BMVA Press, 2009), pp. 124\u20131.","DOI":"10.5244\/C.23.124"},{"issue":"1","key":"194_CR52","doi-asserted-by":"crossref","first-page":"60","DOI":"10.1007\/s11263-012-0594-8","volume":"103","author":"H Wang","year":"2013","unstructured":"H Wang, A Kl\u00e4ser, C Schmid, C Liu, Dense trajectories and motion boundary descriptors for action recognition. Int\u2019l J. Comp. Vision. 103(1), 60\u201379 (2013).","journal-title":"Int\u2019l J. Comp. Vision"},{"key":"194_CR53","doi-asserted-by":"crossref","unstructured":"C Sch\u00fcldt, I Laptev, B Caputo, in Pattern Recognition, 2004. ICPR 2004. Proceedings of the 17th International Conference on, 3. Recognizing human actions: a local SVM approach (IEEE, 2004), pp. 32\u201336.","DOI":"10.1109\/ICPR.2004.1334462"},{"key":"194_CR54","doi-asserted-by":"crossref","unstructured":"M Marsza\u0142ek, I Laptev, C Schmid, in Proc. IEEE Conference on Computer Vision & Pattern Recognition. Actions in context, (2009).","DOI":"10.1109\/CVPR.2009.5206557"},{"key":"194_CR55","doi-asserted-by":"crossref","unstructured":"H Kuehne, H Jhuang, E Garrote, T Poggio, T Serre, in Proc. Int\u2019l. Conf. on Computer Vision. HMDB: a large video database for human motion recognition, (IEEE, 2011).","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"194_CR56","unstructured":"K Soomro, AR Zamir, M Shah, UCF101: A dataset of 101 human actions classes from videos in the wild (2012). arXiv preprint arXiv:1212.0402."},{"issue":"6\/7","key":"194_CR57","doi-asserted-by":"crossref","first-page":"477","DOI":"10.1016\/S0920-5489(97)00013-5","volume":"18","author":"M Bordegoni","year":"1997","unstructured":"M Bordegoni, G Faconti, S Feiner, M Maybury, T Rist, S Ruggieri, P Trahanias, M Wilson, A standard reference model for intelligent multimedia presentation systems. Comput. Standards Interfaces. 18(6\/7), 477\u2013496 (1997).","journal-title":"Comput. Standards Interfaces"},{"key":"194_CR58","doi-asserted-by":"crossref","first-page":"213","DOI":"10.1016\/j.neuroimage.2012.11.031","volume":"67","author":"C Bordier","year":"2013","unstructured":"C Bordier, F Puja, E Macaluso, Sensory processing during viewing of cinematographic material: computational modeling and functional neuroimaging. NeuroImage. 67:, 213\u2013226 (2013). doi: 10.1016\/j.neuroimage.2012.11.031 .","journal-title":"NeuroImage"},{"issue":"4","key":"194_CR59","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1167\/13.4.1","volume":"13","author":"NM Ross","year":"2013","unstructured":"NM Ross, E Kowler, Eye movements while viewing narrated, captioned, and silent videos. J. Vision. 13(4), 1\u201317 (2013). doi: 10.1167\/13.4.1 .","journal-title":"J. Vision"},{"issue":"5","key":"194_CR60","doi-asserted-by":"crossref","first-page":"299","DOI":"10.1007\/s00530-008-0142-0","volume":"14","author":"K Pastra","year":"2008","unstructured":"K Pastra, COSMOROE: a cross-media relations framework for modelling multimedia dialectics. Multimedia Syst. 14(5), 299\u2013323 (2008).","journal-title":"Multimedia Syst"},{"issue":"7","key":"194_CR61","doi-asserted-by":"crossref","first-page":"1325","DOI":"10.1109\/TMM.2008.2004911","volume":"10","author":"S Arifin","year":"2008","unstructured":"S Arifin, PYK Cheung, Affective level video segmentation by utilizing the pleasure-arousal-dominance information. IEEE Trans. Multimedia. 10(7), 1325\u20131341 (2008).","journal-title":"IEEE Trans. Multimedia"},{"key":"194_CR62","doi-asserted-by":"crossref","unstructured":"S Zhao, H Yao, X Sun, P Xu, X Liu, R Ji, in Proc. 19th ACM Int\u2019l. Conf. Multimedia. Video indexing and recommendation based on affective analysis of viewers, (2011).","DOI":"10.1145\/2072298.2072043"},{"key":"194_CR63","unstructured":"E Douglas-Cowie, R Cowie, I Sneddon, C Cox, O Lowry, M McRorie, J-C Martin, L Devillers, S Abrilian, A Batliner, N Amir, K Karpouzis, in Proc. 2nd Int\u2019l. Conf. Affective Comput. Intell. Interaction. The HUMAINE database: addressing the collection and annotation of naturalistic and induced emotional data, (2007), pp. 488\u2013500."},{"issue":"7","key":"194_CR64","doi-asserted-by":"crossref","first-page":"1153","DOI":"10.1080\/02699930903274322","volume":"24","author":"A Schaefer","year":"2010","unstructured":"A Schaefer, F Nils, X Sanchez, P Philippot, Assessing the effectiveness of a large database of emotion-eliciting films: A new tool for emotion researchers. Cogn. Emotion. 24(7), 1153\u20131172 (2010).","journal-title":"Cogn. Emotion"},{"issue":"1","key":"194_CR65","doi-asserted-by":"crossref","first-page":"18","DOI":"10.1109\/T-AFFC.2011.15","volume":"3","author":"S Koelstra","year":"2012","unstructured":"S Koelstra, C Muhl, M Soleymani, J-S Lee, A Yazdani, T Ebrahimi, T Pun, A Nijholt, I Patras, DEAP: a database for emotion analysis using physiological signals. IEEE Trans. Affective Comput.3(1), 18\u201331 (2012).","journal-title":"IEEE Trans. Affective Comput."},{"issue":"1","key":"194_CR66","doi-asserted-by":"crossref","first-page":"42","DOI":"10.1109\/T-AFFC.2011.25","volume":"3","author":"M Soleymani","year":"2012","unstructured":"M Soleymani, J Lichtenauer, T Pun, M Pantic, A multimodal database for affect recognition and implicit tagging. IEEE Trans. Affective Comput.3(1), 42\u201355 (2012).","journal-title":"IEEE Trans. Affective Comput."},{"issue":"1","key":"194_CR67","doi-asserted-by":"crossref","first-page":"43","DOI":"10.1109\/TAFFC.2015.2396531","volume":"6","author":"Y Baveye","year":"2015","unstructured":"Y Baveye, E Dellandrea, C Chamaret, L Chen, LIRIS-ACCEDE: a video database for affective content analysis. IEEE Trans. Affective Comput.6(1), 43\u201355 (2015).","journal-title":"IEEE Trans. Affective Comput."},{"key":"194_CR68","doi-asserted-by":"crossref","unstructured":"M Kipp, in Proc. Eurospeech-2001. Anvil\u2014a generic annotation tool for multimodal dialogue, (2001).","DOI":"10.21437\/Eurospeech.2001-354"},{"key":"194_CR69","unstructured":"B Pellom, K Hacioglu, Sonic: the university of colorado continuous speech recognizer. Rep. tr-cslr-2001-01, University of Colorado, Boulder, Tech. (2001)."},{"key":"194_CR70","unstructured":"H Schmid, in Proc. Int\u2019l. Conf. New Methods in Language Processing. Probabilistic part-of-speech tagging using decision trees, (1994)."},{"key":"194_CR71","doi-asserted-by":"crossref","unstructured":"P Bojanowski, R Lajugie, F Bach, I Laptev, J Ponce, C Schmid, J Sivic, in Proc. IEEE European Conference on Computer Vision. Weakly supervised action labeling in videos under ordering constraints, (2014).","DOI":"10.1007\/978-3-319-10602-1_41"},{"key":"194_CR72","unstructured":"P Wittenburg, H Brugman, A Russel, A Klassmann, H Sloetjes, in Proc. 5th Int\u2019l. Conf. on Language Resources and Evaluation. ELAN: a professional framework for multimodality research, (2006)."},{"key":"194_CR73","unstructured":"N Malandrakis, A Potamianos, G Evangelopoulos, A Zlatintsi, in Proc. Int\u2019l. Conf. on Acoustics, Speech and Signal Process. A supervised approach to movie emotion tracking, (2011), pp. 2376\u20132379."},{"key":"194_CR74","unstructured":"R Dietz, A Lang, in Proc. Cognitive Technology Conf. Affective agents: effects of agent affect on arousal, attention, liking and learning, (1999)."},{"issue":"2","key":"194_CR75","doi-asserted-by":"crossref","first-page":"90","DOI":"10.1109\/MSP.2006.1621452","volume":"23","author":"A Hanjalic","year":"2006","unstructured":"A Hanjalic, Extracting moods from pictures and sounds: Towards truly personalized TV. IEEE Signal Process. Mag.23(2), 90\u2013100 (2006). IEEE.","journal-title":"IEEE Signal Process. Mag."},{"issue":"6","key":"194_CR76","doi-asserted-by":"crossref","first-page":"689","DOI":"10.1109\/TCSVT.2006.873781","volume":"16","author":"HL Wang","year":"2006","unstructured":"HL Wang, LF Cheong, Affective understanding in film. IEEE Trans. Circ. Syst. Video Technol.16(6), 689\u2013704 (2006).","journal-title":"IEEE Trans. Circ. Syst. Video Technol."},{"key":"194_CR77","unstructured":"R Cowie, E Douglas-Cowie, S Savvidou, E McMahon, M Sawey, M Schr\u00f6der, in Proc. ISCA Workshop on Speech & Emotion. \u2019FEELTRACE\u2019: an instrument for recording perceived emotion in real time, (2000), pp. 19\u201324."},{"key":"194_CR78","unstructured":"M Grimm, K Kroschel, in Proc. IEEE Workshop on Automatic Speech Recognition and Understanding. Evaluation of natural emotions using self assessment manikins, (2005), pp. 381\u2013385."},{"key":"194_CR79","doi-asserted-by":"crossref","first-page":"15","DOI":"10.1016\/j.image.2015.08.004","volume":"38","author":"P Koutras","year":"2015","unstructured":"P Koutras, P Maragos, A perceptually based spatio-temporal computational framework for visual saliency estimation. Signal Process. Image Commun.38:, 15\u201331 (2015).","journal-title":"Signal Process. Image Commun."},{"issue":"11","key":"194_CR80","doi-asserted-by":"crossref","first-page":"1254","DOI":"10.1109\/34.730558","volume":"20","author":"L Itti","year":"1998","unstructured":"L Itti, C Koch, E Niebur, A model of saliency-based visual attention for rapid scene analysis. IEEE Trans. Pattern Anal. Mach. Intell.20(11), 1254\u20131259 (1998).","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"194_CR81","unstructured":"S Gao, K Yang, C Li, Y Li, in Proceedings of the IEEE international conference on computer vision. A color constancy model with double-opponency mechanisms, (2013), pp. 929\u2013936."},{"issue":"8","key":"194_CR82","doi-asserted-by":"crossref","first-page":"1455","DOI":"10.1364\/JOSAA.4.001455","volume":"4","author":"DJ Heeger","year":"1987","unstructured":"DJ Heeger, Model for the extraction of image flow. J. Opt. Soc. Amer.4(8), 1455\u20131471 (1987).","journal-title":"J. Opt. Soc. Amer."},{"issue":"2","key":"194_CR83","doi-asserted-by":"crossref","first-page":"227","DOI":"10.1109\/83.821736","volume":"9","author":"JP Havlicek","year":"2000","unstructured":"JP Havlicek, DS Harding, AC Bovik, Multidimensional quasi-eigenfunction approximations and multicomponent am-fm models. IEEE Trans. Image Process.9(2), 227\u2013242 (2000).","journal-title":"IEEE Trans. Image Process."},{"key":"194_CR84","doi-asserted-by":"crossref","first-page":"691","DOI":"10.1109\/18.119731","volume":"38","author":"AC Bovik","year":"1992","unstructured":"AC Bovik, N Gopal, T Emmoth, A Restrepo, Localized measurement of emergent image frequencies by Gabor Wavelets. IEEE Trans. Inf. Theory. 38:, 691\u2013712 (1992).","journal-title":"IEEE Trans. Inf. Theory"},{"issue":"4","key":"194_CR85","doi-asserted-by":"crossref","first-page":"437","DOI":"10.1016\/j.conb.2007.07.011","volume":"17","author":"JB Fritz","year":"2007","unstructured":"JB Fritz, M Elhilali, SV David, SA Shamma, Auditory attention\u2014focusing the searchlight on sound. Curr. Opin. Neurobiol.17(4), 437\u2013455 (2007).","journal-title":"Curr. Opin. Neurobiol."},{"key":"194_CR86","unstructured":"JF Kaiser, in Proc. IEEE Int\u2019l. Conf. Acoust., Speech, Signal Process. On a simple algorithm to calculate the energy of a signal, (1990)."},{"key":"194_CR87","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-662-09562-1","volume-title":"Psychoacoustics, Facts and Models","author":"E Zwicker","year":"1999","unstructured":"E Zwicker, H Fastl, Psychoacoustics, Facts and Models, 2nd edn. (Springer, Berlin Heidelberg, 1999)."},{"key":"194_CR88","doi-asserted-by":"crossref","first-page":"548","DOI":"10.1121\/1.1909741","volume":"38","author":"R Plomp","year":"1965","unstructured":"R Plomp, WJM Levelt, Tonal consonance and critical bandwidth. Jour. Acoust. Soc. Am. (JASA). 38:, 548\u2013560 (1965).","journal-title":"Jour. Acoust. Soc. Am. (JASA)"},{"key":"194_CR89","unstructured":"PN Vassilakis, Perceptual and physical properties of amplitude fluctuation and their musical significance. PhD thesis, Univ. of California (2001)."},{"key":"194_CR90","unstructured":"P Nakov, S Rosenthal, Z Kozareva, V Stoyanov, A Ritter, T Wilson, in Proc. of 2nd Joint Conf. on Lexical and Computational Semantics (*SEM), 7th Int\u2019l. Workshop on Semantic Evaluation. Semeval 2013 task 2: Sentiment analysis in twitter, (2013), pp. 312\u2013320."},{"issue":"2","key":"194_CR91","doi-asserted-by":"crossref","first-page":"293","DOI":"10.1109\/TSA.2004.838534","volume":"13","author":"CM Lee","year":"2005","unstructured":"CM Lee, SS Narayanan, Toward detecting emotions in spoken dialogs. IEEE Trans. Speech Audio Process.13(2), 293\u2013303 (2005).","journal-title":"IEEE Trans. Speech Audio Process."},{"issue":"11","key":"194_CR92","doi-asserted-by":"crossref","first-page":"2379","DOI":"10.1109\/TASL.2013.2277931","volume":"21","author":"N Malandrakis","year":"2013","unstructured":"N Malandrakis, A Potamianos, E Iosif, S Narayanan, Distributional semantic models for affective text analysis. IEEE Trans. Audio Speech Lang. Process.21(11), 2379\u201392 (2013).","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"194_CR93","doi-asserted-by":"crossref","unstructured":"Z Harris, Distributional structure. Word. 10(23), 146\u2013162 (1954).","DOI":"10.1080\/00437956.1954.11659520"},{"key":"194_CR94","unstructured":"M Bradley, P Lang, Affective norms for English words (ANEW): stimuli, instruction manual and affective ratings. Tech. report C-1 (The Center for Research in Psychophysiology, Univ. of Florida, 1999)."},{"key":"194_CR95","unstructured":"A Zlatintsi, P Maragos, A Potamianos, G Evangelopoulos, in Proc. European Signal Process. Conf. A saliency-based approach to audio event detection and summarization, (2012), pp. 1294\u20131298."},{"key":"194_CR96","doi-asserted-by":"crossref","first-page":"135","DOI":"10.1016\/B978-012119792-6\/50072-3","volume-title":"The Image and Video Processing Handbook","author":"P Maragos","year":"2005","unstructured":"P Maragos, in The Image and Video Processing Handbook. 2nd edn., ed. by AC Bovik. Morphological filtering for image enhancement and feature detection (Academic Press, IncOrlando, 2005), pp. 135\u2013156."},{"key":"194_CR97","unstructured":"A Zlatintsi, P Koutras, N Efthymiou, P Maragos, A Potamianos, K Pastra, in Proc. 7th Int\u2019l. Workshop on Quality of Multimedia Experience (QoMEX-2015), Costa Navarino, Messinia, Greece. Quality evaluation of computational models for movie summarization, (2015), pp. 1\u20136."}],"container-title":["EURASIP Journal on Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s13640-017-0194-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1186\/s13640-017-0194-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s13640-017-0194-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,8,24]],"date-time":"2023-08-24T17:48:25Z","timestamp":1692899305000},"score":1,"resource":{"primary":{"URL":"https:\/\/jivp-eurasipjournals.springeropen.com\/articles\/10.1186\/s13640-017-0194-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,8,7]]},"references-count":97,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2017,12]]}},"alternative-id":["194"],"URL":"https:\/\/doi.org\/10.1186\/s13640-017-0194-1","relation":{},"ISSN":["1687-5281"],"issn-type":[{"value":"1687-5281","type":"electronic"}],"subject":[],"published":{"date-parts":[[2017,8,7]]},"article-number":"54"}}