{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T12:52:15Z","timestamp":1783601535421,"version":"3.55.0"},"reference-count":30,"publisher":"IEEE","license":[{"start":{"date-parts":[[2019,10,1]],"date-time":"2019-10-01T00:00:00Z","timestamp":1569888000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2019,10,1]],"date-time":"2019-10-01T00:00:00Z","timestamp":1569888000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2019,10,1]],"date-time":"2019-10-01T00:00:00Z","timestamp":1569888000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019,10]]},"DOI":"10.1109\/mlsp.2019.8918712","type":"proceedings-article","created":{"date-parts":[[2019,12,6]],"date-time":"2019-12-06T03:23:52Z","timestamp":1575602632000},"page":"1-6","source":"Crossref","is-referenced-by-count":6,"title":["Audio-Visual Fusion And Conditioning With Neural Networks For Event Recognition"],"prefix":"10.1109","author":[{"given":"Mathilde","family":"Brousmiche","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jean","family":"Rouat","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Stephane","family":"Dupont","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref30","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v30i1.10471","article-title":"Look, listen and learna multimodal lstm for speaker identification","author":"ren","year":"2016","journal-title":"THIRTIETH AAAI Conference on Artificial Intelligence"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.41"},{"key":"ref11","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v32i1.11671","article-title":"Film: Visual reasoning with a general conditioning layer","author":"perez","year":"2018","journal-title":"Thirty-Second AAAI Conference on Artificial Intelligence"},{"key":"ref12","first-page":"568","article-title":"Two-stream convolutional networks for action recognition in videos","author":"simonyan","year":"2014","journal-title":"Advances in neural information processing systems"},{"key":"ref13","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v32i1.12319","article-title":"Multimodal keyless attention fusion for video classification","author":"long","year":"2018","journal-title":"Thirty-Second AAAI Conference on Artificial Intelligence"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/s00530-010-0182-0"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/1101149.1101236"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1016\/j.neuroimage.2013.11.007"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2018.06.005"},{"key":"ref18","article-title":"Cross-domain deep feature combination for bird species classification with audio-visual data","author":"naranchimeg","year":"2018","journal-title":"arXiv preprint arXiv 1811 10199"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1145\/3242969.3243014"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8462200"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.510"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.243"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"ref6","article-title":"Deep audio-visual speech recognition","author":"afouras","year":"2018","journal-title":"IEEE Trans PAMI"},{"key":"ref29","first-page":"2579","article-title":"Visualizing data using t-sne","volume":"9","author":"van der maaten","year":"2008","journal-title":"Journal of Machine Learning Research"},{"key":"ref5","author":"goldstein","year":"2016","journal-title":"Sensation and Perception"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1162\/089892999563544"},{"key":"ref7","first-page":"307","author":"marechal","year":"2019","journal-title":"Survey on AI-Based Multi-modal Methods for Emotion Detection"},{"key":"ref2","article-title":"The kinetics human action video dataset","author":"kay","year":"2017","journal-title":"arXiv preprint arXiv 1705 06950"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1016\/j.neuroscience.2019.01.039"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.789"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01216-8_16"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.167"},{"key":"ref21","first-page":"818","article-title":"Visualizing and understanding convolutional networks","author":"zeiler","year":"2014","journal-title":"European Conference on Computer Vision"},{"key":"ref24","first-page":"6594","article-title":"Modulating early visual processing by language","author":"de vries","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2017-556"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.170"},{"key":"ref25","article-title":"From visual to acoustic question answering","author":"abdelnour","year":"2019","journal-title":"arXiv preprint arXiv 1902 10869"}],"event":{"name":"2019 IEEE 29th International Workshop on Machine Learning for Signal Processing (MLSP)","location":"Pittsburgh, PA, USA","start":{"date-parts":[[2019,10,13]]},"end":{"date-parts":[[2019,10,16]]}},"container-title":["2019 IEEE 29th International Workshop on Machine Learning for Signal Processing (MLSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8911118\/8918685\/08918712.pdf?arnumber=8918712","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,10,7]],"date-time":"2022-10-07T17:09:17Z","timestamp":1665162557000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8918712\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,10]]},"references-count":30,"URL":"https:\/\/doi.org\/10.1109\/mlsp.2019.8918712","relation":{},"subject":[],"published":{"date-parts":[[2019,10]]}}}