{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T15:09:21Z","timestamp":1785856161738,"version":"3.56.0"},"reference-count":65,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"1","license":[{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"Estonian Research Grant","award":["PUT638"],"award-info":[{"award-number":["PUT638"]}]},{"name":"Spanish projects","award":["TIN2013-43478-P"],"award-info":[{"award-number":["TIN2013-43478-P"]}]},{"name":"Spanish projects","award":["TIN2016-74946-P"],"award-info":[{"award-number":["TIN2016-74946-P"]}]},{"name":"European Commission Horizon 2020","award":["H2020-ICT-2015"],"award-info":[{"award-number":["H2020-ICT-2015"]}]},{"name":"Estonian Centre of Excellence in IT"},{"DOI":"10.13039\/501100008530","name":"European Regional Development Fund","doi-asserted-by":"publisher","award":["iV&L Net"],"award-info":[{"award-number":["iV&L Net"]}],"id":[{"id":"10.13039\/501100008530","id-type":"DOI","asserted-by":"publisher"}]},{"name":"European Network on Integrating Vision and Language","award":["iV&L Net"],"award-info":[{"award-number":["iV&L Net"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Affective Comput."],"published-print":{"date-parts":[[2019,1,1]]},"DOI":"10.1109\/taffc.2017.2713783","type":"journal-article","created":{"date-parts":[[2017,6,9]],"date-time":"2017-06-09T18:42:54Z","timestamp":1497033774000},"page":"60-75","source":"Crossref","is-referenced-by-count":205,"title":["Audio-Visual Emotion Recognition in Video Clips"],"prefix":"10.1109","volume":"10","author":[{"given":"Fatemeh","family":"Noroozi","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Marina","family":"Marjanovic","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Angelina","family":"Njegus","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0617-8873","authenticated-orcid":false,"given":"Sergio","family":"Escalera","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8460-5717","authenticated-orcid":false,"given":"Gholamreza","family":"Anbarjafari","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/1386352.1386389"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICICIC.2006.383"},{"key":"ref33","doi-asserted-by":"crossref","first-page":"609","DOI":"10.1007\/978-3-642-24600-5_64","article-title":"Audio visual emotion recognition based on triple-stream dynamic Bayesian network models","author":"jiang","year":"2011","journal-title":"Proc Int Conf Affective Comput Intell Interaction"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1145\/1816041.1816069"},{"key":"ref31","article-title":"Multimodal recognition of emotions in car environments","author":"datcu","year":"2009","journal-title":"Driver Car Interaction & Interface"},{"key":"ref30","first-page":"1","article-title":"Audio-visual emotion recognition using FCBF feature selection method and particle swarm optimization for fuzzy ARTMAP neural networks","volume":"76","author":"gharavian","year":"2016","journal-title":"Multimedia Tools Appl"},{"key":"ref37","first-page":"1","article-title":"A combined rule-based and machine learning audio-visual emotion recognition approach","author":"seng","year":"2016","journal-title":"IEEE Trans Affective Comput"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-13117-7_207"},{"key":"ref35","first-page":"1","article-title":"Emotion recognition from audio and visual data using F-score based fusion","author":"gera","year":"2014","journal-title":"Proc 1st IKDD Conf Data Sci"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2013.6607472"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-7908-2604-3_16"},{"key":"ref61","first-page":"252","article-title":"Deep expectation of real and apparent age from a single image without facial landmarks","author":"rothe","year":"2016","journal-title":"Int J Comput Vis"},{"key":"ref63","article-title":"A tutorial on deep learning part 1: Nonlinear classifiers and the backpropagation algorithm","author":"le","year":"2015"},{"key":"ref28","first-page":"1","article-title":"A novel multimodal emotion recognition approach for affective human robot interaction","author":"cid","year":"2015","journal-title":"Proc FinE"},{"key":"ref64","doi-asserted-by":"crossref","first-page":"27","DOI":"10.1145\/2647868.2654934","article-title":"Say cheese versus smile: Reducing speech-related variability for facial emotion recognition","author":"kim","year":"2014","journal-title":"Proc 22nd ACM Int Conf Multimedia"},{"key":"ref27","first-page":"145","article-title":"Low-level fusion of audio, video feature for multi-modal emotion recognition","author":"wimmer","year":"2008","journal-title":"Proc 3rd Int Conf Comput Vis Theory Appl"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1145\/2911996.2912001"},{"key":"ref29","first-page":"27","article-title":"Bimodal human emotion classification in the speaker-dependent scenario","volume":"52","author":"haq","year":"2015","journal-title":"Proc Pakistan Acad Sci"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/THMS.2014.2303083"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/TCE.2011.6131135"},{"key":"ref20","article-title":"Efficiency of chosen speech descriptors in relation to emotion recognition","volume":"2017","author":"kami?ska","year":"2017","journal-title":"EURASIP J Audio Speech Music Process"},{"key":"ref22","article-title":"Surrey audio-visual expressed emotion(savee) database","author":"jackson","year":"2015"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/s10772-017-9396-2"},{"key":"ref24","article-title":"Ryerson multimedia research laboratory (RML)","author":"xie","year":"2010"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICDEW.2006.145"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2012.2189550"},{"key":"ref25","first-page":"1","article-title":"EmoNets: Multimodal deep learning approaches for emotion recognition in video","volume":"10","author":"kahou","year":"2015","journal-title":"J Multimodal User Interfaces"},{"key":"ref50","doi-asserted-by":"crossref","DOI":"10.1037\/0096-1523.26.2.527","article-title":"Configural information in facial expression perception","volume":"26","author":"calder","year":"2000","journal-title":"Journal of Experimental Psychology Human Perception and Performance"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/s00426-013-0492-x"},{"key":"ref59","year":"2010"},{"key":"ref58","year":"2015"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/INISTA.2014.6873606"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2010.1005"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-009-0344-2"},{"key":"ref54","first-page":"5","article-title":"Random forests","volume":"45","author":"statistics","year":"2001"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/BF00994018"},{"key":"ref52","first-page":"65","article-title":"A tutorial on princial components analysis","volume":"51","author":"lindsay","year":"2002"},{"key":"ref10","doi-asserted-by":"crossref","first-page":"227","DOI":"10.1007\/978-3-319-10662-5_28","article-title":"Emotion recognition for affect aware video games","author":"szwoch","year":"2015","journal-title":"Image Processing & Communications Challenges"},{"key":"ref11","doi-asserted-by":"crossref","DOI":"10.1515\/9781503623125","author":"bolinger","year":"1989","journal-title":"Intonation and its Uses Melody in Grammar and Discourse"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.2478\/hukin-2013-0063"},{"key":"ref12","doi-asserted-by":"crossref","first-page":"392","DOI":"10.1007\/978-3-642-31561-9_44","article-title":"Survey of the facial expression recognition research","author":"wu","year":"2012","journal-title":"Proc Brain Inspired Cognit Syst"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TSMCB.2005.854502"},{"key":"ref14","first-page":"355","article-title":"Adaptive window strategy for high-speed and robust KLT feature tracker","author":"ramakrishnan","year":"2015","journal-title":"Proc Pacific-Rim Symp Image Video Technol"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-013-1786-0"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2015.2462338"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2015.2412377"},{"key":"ref18","article-title":"A study of techniques for facial detection and expression classification","volume":"5","author":"hemalatha","year":"2014","journal-title":"Int J Comput Sci Eng Survey"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.5772\/4847"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2016.7899608"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/FG.2017.102"},{"key":"ref6","first-page":"115","article-title":"Cooperative learning and its application to emotion recognition from speech","volume":"23","author":"zhang","year":"2015","journal-title":"IEEE Transactions on Audio Speech and Language Processing"},{"key":"ref5","first-page":"231","article-title":"Extending touch-less interaction on vision based wearable device","author":"lv","year":"2015","journal-title":"Proc IEEE Virtual Reality"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.2196\/mhealth.2994"},{"key":"ref7","first-page":"1","article-title":"SMILE: A portable humanoid robot emotion interface","author":"russell","year":"2014","journal-title":"Proc 9th ACM\/IEEE Int Conf Human-Robot Interaction Workshop Appl Emotional Robots"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ISSPA.2010.5605491"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1007\/s11036-015-0586-3"},{"key":"ref46","first-page":"137","article-title":"Human head pose estimation on SASE database using random Hough regression forests","author":"l\u00fcsi","year":"2016","journal-title":"Proc Int FFER workshop on Face and Facial Expression Recognition from Real World Videos"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1007\/s10772-017-9396-2"},{"key":"ref48","author":"bocharova","year":"2010","journal-title":"Compression for Multimedia"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TASSP.1980.1163420"},{"key":"ref42","first-page":"2303","article-title":"Video key frame selection by clustering wavelet coefficients","author":"hasebe","year":"2004","journal-title":"Proc 12th Eur Signal Process Conf"},{"key":"ref41","first-page":"866","article-title":"Adaptive key frame extraction using unsupervised clustering","author":"zhuang","year":"1998","journal-title":"Proc Int Conf Image Process"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.4018\/978-1-61520-919-4.ch017"},{"key":"ref43","first-page":"1","article-title":"Comparison between decision-level and feature-level fusion of acoustic and linguistic features for spontaneous emotion recognition","author":"planet","year":"2012","journal-title":"Proc 7th Iberian Conf Inf Syst Technol"}],"container-title":["IEEE Transactions on Affective Computing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/5165369\/8662807\/07945502.pdf?arnumber=7945502","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,6,24]],"date-time":"2024-06-24T17:57:47Z","timestamp":1719251867000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/7945502\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,1,1]]},"references-count":65,"journal-issue":{"issue":"1"},"URL":"https:\/\/doi.org\/10.1109\/taffc.2017.2713783","relation":{},"ISSN":["1949-3045","2371-9850"],"issn-type":[{"value":"1949-3045","type":"electronic"},{"value":"2371-9850","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,1,1]]}}}