{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,23]],"date-time":"2026-02-23T10:46:49Z","timestamp":1771843609918,"version":"3.50.1"},"reference-count":41,"publisher":"Springer Science and Business Media LLC","issue":"24","license":[{"start":{"date-parts":[[2023,11,18]],"date-time":"2023-11-18T00:00:00Z","timestamp":1700265600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,11,18]],"date-time":"2023-11-18T00:00:00Z","timestamp":1700265600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62102159"],"award-info":[{"award-number":["62102159"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62272178"],"award-info":[{"award-number":["62272178"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100013139","name":"Humanities and Social Science Fund of Ministry of Education of China","doi-asserted-by":"publisher","award":["21YJC870002"],"award-info":[{"award-number":["21YJC870002"]}],"id":[{"id":"10.13039\/501100013139","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Knowledge Innovation Program of Wuhan-Shuguang Project","award":["2022010801020287"],"award-info":[{"award-number":["2022010801020287"]}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["CCNU22QN017"],"award-info":[{"award-number":["CCNU22QN017"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003819","name":"Natural Science Foundation of Hubei Province","doi-asserted-by":"publisher","award":["2023AFB1018"],"award-info":[{"award-number":["2023AFB1018"]}],"id":[{"id":"10.13039\/501100003819","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2023,12]]},"DOI":"10.1007\/s10489-023-05146-7","type":"journal-article","created":{"date-parts":[[2023,11,18]],"date-time":"2023-11-18T09:02:23Z","timestamp":1700298143000},"page":"30431-30442","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Dynamic interactive learning network for audio-visual event localization"],"prefix":"10.1007","volume":"53","author":[{"given":"Jincai","family":"Chen","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Han","family":"Liang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ruili","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiangfeng","family":"Zeng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ping","family":"Lu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,11,18]]},"reference":[{"key":"5146_CR1","doi-asserted-by":"publisher","first-page":"296","DOI":"10.1016\/j.apacoust.2018.06.013","volume":"140","author":"SM Adnan","year":"2018","unstructured":"Adnan SM, Irtaza A et al (2018) Fall detection through acoustic local ternary patterns. Appl Acoust 140:296\u2013300","journal-title":"Appl Acoust"},{"issue":"21","key":"5146_CR2","doi-asserted-by":"publisher","first-page":"15892","DOI":"10.1109\/JIOT.2021.3067905","volume":"8","author":"F Yang","year":"2021","unstructured":"Yang F, Wu Q et al (2021) Internet-of-things-enabled data fusion method for sleep healthcare applications. IEEE Internet Things J 8(21):15892\u201315905","journal-title":"IEEE Internet Things J"},{"issue":"14","key":"5146_CR3","doi-asserted-by":"publisher","first-page":"3035","DOI":"10.3390\/s19143035","volume":"19","author":"D Cruz-Sandoval","year":"2019","unstructured":"Cruz-Sandoval D, Beltran-Marquez J et al (2019) Semi-automated data labeling for activity recognition in pervasive healthcare. Sensors 19(14):3035","journal-title":"Sensors"},{"key":"5146_CR4","doi-asserted-by":"crossref","unstructured":"Zeng R, Huang W et al (2019) Graph convolutional networks for temporal action localization. In: ICCV, pp 7094\u20137103","DOI":"10.1109\/ICCV.2019.00719"},{"key":"5146_CR5","doi-asserted-by":"crossref","unstructured":"Zhang C, Xu Y et al (2019) Adversarial seeded sequence growing for weakly-supervised temporal action localization. In: ACM MM, pp 738\u2013746","DOI":"10.1145\/3343031.3351044"},{"key":"5146_CR6","doi-asserted-by":"crossref","unstructured":"Zhang C, Li G et al (2023) Exploiting completeness and uncertainty of pseudo labels for weakly supervised video anomaly detection. In: CVPR, pp 16271\u201316280","DOI":"10.1109\/CVPR52729.2023.01561"},{"key":"5146_CR7","doi-asserted-by":"crossref","unstructured":"Tian Y, Shi J et al (2018) Audio-visual event localization in unconstrained videos. In: ECCV, pp 247\u2013263","DOI":"10.1007\/978-3-030-01216-8_16"},{"key":"5146_CR8","doi-asserted-by":"crossref","unstructured":"Lin Y-B, Li Y-J, Wang Y-CF (2019) Dual-modality seq2seq network for audio-visual event localization. In: ICASSP. IEEE, pp 2002\u20132006","DOI":"10.1109\/ICASSP.2019.8683226"},{"key":"5146_CR9","doi-asserted-by":"crossref","unstructured":"Ramaswamy J (2020) What makes the sound? A dual-modality interacting network for audio-visual event localization. In: ICASSP. IEEE, pp 4372\u20134376","DOI":"10.1109\/ICASSP40776.2020.9053895"},{"key":"5146_CR10","doi-asserted-by":"crossref","unstructured":"Yu J, Cheng Y, Feng R (2021) Mpn: multimodal parallel network for audio-visual event localization. In: ICME. IEEE, pp 1\u20136","DOI":"10.1109\/ICME51207.2021.9428373"},{"key":"5146_CR11","doi-asserted-by":"crossref","unstructured":"Zhou J, Zheng L et al (2021) Positive sample propagation along the audio-visual event line. In: CVPR, pp 8436\u20138444","DOI":"10.1109\/CVPR46437.2021.00833"},{"key":"5146_CR12","doi-asserted-by":"crossref","unstructured":"Hazarika D, Zimmermann R, Poria S (2020) Misa: Modality-invariant and-specific representations for multimodal sentiment analysis. In: ACM MM, pp 1122\u20131131","DOI":"10.1145\/3394171.3413678"},{"key":"5146_CR13","doi-asserted-by":"crossref","unstructured":"Zhao H, Gan C et al (2019) The sound of motions. In: ICCV, pp 1735\u20131744","DOI":"10.1109\/ICCV.2019.00182"},{"key":"5146_CR14","doi-asserted-by":"crossref","unstructured":"Gan C, Huang D et al (2020) Music gesture for visual sound separation. In: CVPR, pp 10478\u201310487","DOI":"10.1109\/CVPR42600.2020.01049"},{"key":"5146_CR15","doi-asserted-by":"crossref","unstructured":"Majumder S, Al-Halah Z, Grauman K (2021) Move2hear: active audio-visual source separation. In: ICCV, pp 275\u2013285","DOI":"10.1109\/ICCV48922.2021.00034"},{"key":"5146_CR16","doi-asserted-by":"crossref","unstructured":"Zhou Y, Wang Z et al (2018) Visual to sound: generating natural sound for videos in the wild. In: CVPR, pp 3550\u20133558","DOI":"10.1109\/CVPR.2018.00374"},{"key":"5146_CR17","doi-asserted-by":"crossref","unstructured":"Gan C, Huang D et al (2020) Foley music: learning to generate music from videos. In: ECCV. Springer, pp 758\u2013775","DOI":"10.1007\/978-3-030-58621-8_44"},{"key":"5146_CR18","doi-asserted-by":"crossref","unstructured":"Hao W, Guan H, Zhang Z (2022) Vag: a uniform model for cross-modal visual-audio mutual generation. IEEE Trans Neural Netw Learn Syst","DOI":"10.1109\/TNNLS.2022.3161314"},{"key":"5146_CR19","doi-asserted-by":"crossref","unstructured":"Nagrani A, Albanie S, Zisserman A (2018) Seeing voices and hearing faces: cross-modal biometric matching. In: CVPR, pp 8427\u20138436","DOI":"10.1109\/CVPR.2018.00879"},{"key":"5146_CR20","doi-asserted-by":"publisher","first-page":"338","DOI":"10.1109\/TMM.2021.3050089","volume":"24","author":"A Zheng","year":"2021","unstructured":"Zheng A, Hu M et al (2021) Adversarial-metric learning for audio-visual cross-modal matching. IEEE Trans Multimed 24:338\u2013351","journal-title":"IEEE Trans Multimed"},{"key":"5146_CR21","doi-asserted-by":"crossref","unstructured":"Afouras T, Asano YM et al (2022) Self-supervised object detection from audio-visual correspondence. In: CVPR, pp 10575\u201310586","DOI":"10.1109\/CVPR52688.2022.01032"},{"key":"5146_CR22","doi-asserted-by":"crossref","unstructured":"Feng F, Ming Y et al (2023) See, move and hear: a local-to-global multi-modal interaction network for video action recognition. Appl Intell 1\u201320","DOI":"10.1007\/s10489-023-04497-5"},{"key":"5146_CR23","doi-asserted-by":"crossref","unstructured":"Yu J, Cheng Y et al (2022) Mm-pyramid: multimodal pyramid attentional network for audio-visual event localization and video parsing. In: ACM MM, pp 6241\u20136249","DOI":"10.1145\/3503161.3547869"},{"key":"5146_CR24","doi-asserted-by":"crossref","unstructured":"Aytar Y, Vondrick C, Torralba A (2016) Soundnet: learning sound representations from unlabeled video. Adv Neural Inf Process Syst 29","DOI":"10.1109\/CVPR.2016.18"},{"key":"5146_CR25","first-page":"9758","volume":"33","author":"H Alwassel","year":"2020","unstructured":"Alwassel H, Mahajan D, Korbar B, Torresani L, Ghanem B, Tran D (2020) Self-supervised learning by cross-modal audio-video clustering. Adv Neural Inf Process Syst 33:9758\u20139770","journal-title":"Adv Neural Inf Process Syst"},{"key":"5146_CR26","doi-asserted-by":"crossref","unstructured":"Arandjelovic R, Zisserman A (2017) Look, listen and learn. In: ICCV, pp 609\u2013617","DOI":"10.1109\/ICCV.2017.73"},{"key":"5146_CR27","doi-asserted-by":"crossref","unstructured":"Arandjelovic R, Zisserman A (2018) Objects that sound. In: ECCV, pp 435\u2013451","DOI":"10.1007\/978-3-030-01246-5_27"},{"key":"5146_CR28","doi-asserted-by":"publisher","first-page":"60","DOI":"10.37394\/232014.2022.18.8","volume":"18","author":"AK Aggarwal","year":"2022","unstructured":"Aggarwal AK (2022) Learning texture features from glcm for classification of brain tumor mri images using random forest classifier. Trans Signal Process 18:60\u201363","journal-title":"Trans Signal Process"},{"key":"5146_CR29","doi-asserted-by":"crossref","unstructured":"Wu Y, Zhu L et al (2019) Dual attention matching for audio-visual event localization. In: ICCV, pp 6292\u20136300","DOI":"10.1109\/ICCV.2019.00639"},{"key":"5146_CR30","doi-asserted-by":"publisher","first-page":"279","DOI":"10.1609\/aaai.v34i01.5361","volume":"34","author":"H Xuan","year":"2020","unstructured":"Xuan H, Zhang Z et al (2020) Cross-modal attention network for temporal inconsistent audio-visual event localization. AAAI 34:279\u2013286","journal-title":"AAAI"},{"key":"5146_CR31","doi-asserted-by":"crossref","unstructured":"Xu H, Zeng R et al (2020) Cross-modal relation-aware networks for audio-visual event localization. In: ACM MM, pp 3893\u20133901","DOI":"10.1145\/3394171.3413581"},{"issue":"12","key":"5146_CR32","doi-asserted-by":"publisher","first-page":"5412","DOI":"10.1109\/TNNLS.2020.2967597","volume":"31","author":"X Xu","year":"2020","unstructured":"Xu X, Wang T, Yang Y, Zuo L, Shen F, Shen HT (2020) Cross-modal attention with semantic consistence for image-text matching. IEEE Trans Neural Netw Learn Syst 31(12):5412\u20135425","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"key":"5146_CR33","doi-asserted-by":"crossref","unstructured":"Guo Y (2022) A mutual attention based multimodal fusion for fake news detection on social network. Appl Intell 1\u201310","DOI":"10.1109\/ACCESS.2022.3229762"},{"key":"5146_CR34","doi-asserted-by":"crossref","unstructured":"Hershey S, Chaudhuri S et al (2017) Cnn architectures for large-scale audio classification. In: ICASSP. IEEE, pp 131\u2013135","DOI":"10.1109\/ICASSP.2017.7952132"},{"key":"5146_CR35","doi-asserted-by":"crossref","unstructured":"Gemmeke JF, Ellis DP et al (2017) Audio set: an ontology and human-labeled dataset for audio events. In: ICASSP. IEEE, pp 776\u2013780","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"5146_CR36","unstructured":"Simonyan K, Zisserman A (2014) Very deep convolutional networks for large-scale image recognition. CVPR"},{"key":"5146_CR37","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky O, Deng J et al (2015) Imagenet large scale visual recognition challenge. Int J Comput Vis 115:211\u2013252","journal-title":"Int J Comput Vis"},{"key":"5146_CR38","doi-asserted-by":"crossref","unstructured":"Liu F, Ren X et al (2018) Simnet: stepwise image-topic merging network for generating detailed and comprehensive image captions. EMNLP","DOI":"10.18653\/v1\/D18-1013"},{"key":"5146_CR39","doi-asserted-by":"crossref","unstructured":"Hu J, Shen L, Sun G (2018) Squeeze-and-excitation networks. In: CVPR, pp 7132\u20137141","DOI":"10.1109\/CVPR.2018.00745"},{"key":"5146_CR40","doi-asserted-by":"publisher","first-page":"1230","DOI":"10.1609\/aaai.v33i01.33011230","volume":"33","author":"K Xu","year":"2019","unstructured":"Xu K, Wang Z et al (2019) A2-net: molecular structure estimation from cryo-em density volumes. AAAI 33:1230\u20131237","journal-title":"AAAI"},{"key":"5146_CR41","doi-asserted-by":"crossref","unstructured":"Ramaswamy J, Das S (2020) See the sound, hear the pixels. In: WACV, pp 2970\u20132979","DOI":"10.1109\/WACV45572.2020.9093616"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-023-05146-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-023-05146-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-023-05146-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,12,28]],"date-time":"2023-12-28T06:22:00Z","timestamp":1703744520000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-023-05146-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,11,18]]},"references-count":41,"journal-issue":{"issue":"24","published-print":{"date-parts":[[2023,12]]}},"alternative-id":["5146"],"URL":"https:\/\/doi.org\/10.1007\/s10489-023-05146-7","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"value":"0924-669X","type":"print"},{"value":"1573-7497","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,11,18]]},"assertion":[{"value":"1 November 2023","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 November 2023","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"We declare that we have no known competing financial interests or personal relationships that could have appeared to influence the work reported in this paper.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}},{"value":"The datset used in this study is openly available at  and does not relate to ethics.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical and informed consent for data used"}}]}}