{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,18]],"date-time":"2025-06-18T04:22:11Z","timestamp":1750220531101,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":37,"publisher":"ACM","license":[{"start":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T00:00:00Z","timestamp":1602460800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2020,10,12]]},"DOI":"10.1145\/3422852.3423486","type":"proceedings-article","created":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T08:40:35Z","timestamp":1602492035000},"page":"5-11","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":2,"title":["Intra and Inter-modality Interactions for Audio-visual Event Detection"],"prefix":"10.1145","author":[{"given":"Mathilde","family":"Brousmiche","sequence":"first","affiliation":[{"name":"University of Mons, Mons, Belgium"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"St\u00e9phane","family":"Dupont","sequence":"additional","affiliation":[{"name":"University of Mons, Mons, Belgium"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jean","family":"Rout","sequence":"additional","affiliation":[{"name":"University of Sherbrooke, Sherbrooke, Canada"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2020,10,12]]},"reference":[{"volume-title":"12th USENIX Symposium on Operating Systems Design and Implementation (OSDI 16)","year":"2016","author":"Abadi Mart'in","key":"e_1_3_2_1_1_1"},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.73"},{"volume-title":"Soundnet: Learning sound representations from unlabeled video. In Advances in Neural Information Processing Systems (NIPS). 892--900.","year":"2016","author":"Aytar Yusuf","key":"e_1_3_2_1_3_1"},{"volume-title":"Proceedings of the 4th International Conference on Learning Representations (ICLR).","year":"2015","author":"Bahdanau Dzmitry","key":"e_1_3_2_1_4_1"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"e_1_3_2_1_6_1","unstructured":"Francois Chollet et almbox. 2015. Keras. https:\/\/github.com\/fchollet\/keras  Francois Chollet et almbox. 2015. Keras. https:\/\/github.com\/fchollet\/keras"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.challengehml-1.1"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"e_1_3_2_1_9_1","unstructured":"E Bruce Goldstein and James Brockmole. 2016. Sensation and perception .Cengage Learning.  E Bruce Goldstein and James Brockmole. 2016. Sensation and perception .Cengage Learning."},{"volume-title":"Thirty-Second AAAI Conference on Artificial Intelligence.","year":"2018","author":"Hao Wangli","key":"e_1_3_2_1_10_1"},{"key":"e_1_3_2_1_11_1","unstructured":"John R Hershey and Javier R Movellan. 2000. Audio vision: Using audio-visual synchrony to locate sounds. In Advances in Neural Information Processing Systems (NIPS). 813--819.  John R Hershey and Javier R Movellan. 2000. Audio vision: Using audio-visual synchrony to locate sounds. In Advances in Neural Information Processing Systems (NIPS). 813--819."},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952132"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Sepp Hochreiter and J\u00fcrgen Schmidhuber. 1997. Long Short-Term Memory. Neural computation Vol. 9 8 (1997) 1735--1780.  Sepp Hochreiter and J\u00fcrgen Schmidhuber. 1997. Long Short-Term Memory. Neural computation Vol. 9 8 (1997) 1735--1780.","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.243"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00559"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2005.274"},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1145\/2647868.2654936"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2017.10.011"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683226"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.12319"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00817"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350871"},{"key":"e_1_3_2_1_23_1","unstructured":"Volodymyr Mnih Nicolas Heess Alex Graves et almbox. 2014. Recurrent models of visual attention. In Advances in Neural Information Processing Systems. 2204--2212.  Volodymyr Mnih Nicolas Heess Alex Graves et almbox. 2014. Recurrent models of visual attention. In Advances in Neural Information Processing Systems. 2204--2212."},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46448-0_48"},{"key":"e_1_3_2_1_25_1","first-page":"23","article-title":"Audio-visual automatic speech recognition: An overview","volume":"22","author":"Potamianos Gerasimos","year":"2004","journal-title":"Issues in Visual and Audio-visual Speech Processing"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053895"},{"volume-title":"Hear the Pixels. In The IEEE Winter Conference on Applications of Computer Vision. 2970--2979","year":"2020","author":"Ramaswamy Janani","key":"e_1_3_2_1_27_1"},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.789"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.5555\/3016387.3016407"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1049\/iet-cvi.2018.5492"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01216-8_16"},{"key":"e_1_3_2_1_32_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is all you need. In Advances in Neural Information Processing Systems (NIPS). 5998--6008.  Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is all you need. In Advances in Neural Information Processing Systems (NIPS). 5998--6008."},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"crossref","unstructured":"Chung-Hsien Wu Jen-Chun Lin and Wen-Li Wei. 2014. Survey on audiovisual emotion recognition: databases features and data fusion strategies. APSIPA Transactions on signal and Information Processing Vol. 3 (2014).  Chung-Hsien Wu Jen-Chun Lin and Wen-Li Wei. 2014. Survey on audiovisual emotion recognition: databases features and data fusion strategies. APSIPA Transactions on signal and Information Processing Vol. 3 (2014).","DOI":"10.1017\/ATSIP.2014.11"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298968"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00639"},{"volume-title":"International Conference on Machine Learning (ICML). 2048--2057","year":"2015","author":"Xu Kelvin","key":"e_1_3_2_1_36_1"},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i01.5361"}],"event":{"name":"MM '20: The 28th ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Seattle WA USA","acronym":"MM '20"},"container-title":["Proceedings of the 1st International Workshop on Human-centric Multimedia Analysis"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3422852.3423486","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3422852.3423486","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T21:24:56Z","timestamp":1750195496000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3422852.3423486"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,12]]},"references-count":37,"alternative-id":["10.1145\/3422852.3423486","10.1145\/3422852"],"URL":"https:\/\/doi.org\/10.1145\/3422852.3423486","relation":{},"subject":[],"published":{"date-parts":[[2020,10,12]]},"assertion":[{"value":"2020-10-12","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}