{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,18]],"date-time":"2026-07-18T17:06:42Z","timestamp":1784394402640,"version":"3.55.0"},"reference-count":69,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"6","license":[{"start":{"date-parts":[[2024,6,1]],"date-time":"2024-06-01T00:00:00Z","timestamp":1717200000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,6,1]],"date-time":"2024-06-01T00:00:00Z","timestamp":1717200000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,6,1]],"date-time":"2024-06-01T00:00:00Z","timestamp":1717200000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Plan of China","doi-asserted-by":"publisher","award":["2020AAA0106200"],"award-info":[{"award-number":["2020AAA0106200"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61721004"],"award-info":[{"award-number":["61721004"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61936005"],"award-info":[{"award-number":["61936005"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62002355"],"award-info":[{"award-number":["62002355"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62036012"],"award-info":[{"award-number":["62036012"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62072286"],"award-info":[{"award-number":["62072286"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62102415"],"award-info":[{"award-number":["62102415"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62106262"],"award-info":[{"award-number":["62106262"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62236008"],"award-info":[{"award-number":["62236008"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62325206"],"award-info":[{"award-number":["62325206"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U21B2044"],"award-info":[{"award-number":["U21B2044"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004826","name":"Beijing Natural Science Foundation","doi-asserted-by":"publisher","award":["L201001"],"award-info":[{"award-number":["L201001"]}],"id":[{"id":"10.13039\/501100004826","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Open Research Projects of Zhejiang Lab","award":["2022RC0AB02"],"award-info":[{"award-number":["2022RC0AB02"]}]},{"name":"Key Research and Development Program of Jiangsu Province","award":["BE2023016-4"],"award-info":[{"award-number":["BE2023016-4"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Circuits Syst. Video Technol."],"published-print":{"date-parts":[[2024,6]]},"DOI":"10.1109\/tcsvt.2023.3337134","type":"journal-article","created":{"date-parts":[[2023,11,27]],"date-time":"2023-11-27T20:14:07Z","timestamp":1701116047000},"page":"4843-4856","source":"Crossref","is-referenced-by-count":17,"title":["Multimodal Imbalance-Aware Gradient Modulation for Weakly-Supervised Audio-Visual Video Parsing"],"prefix":"10.1109","volume":"34","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3877-7814","authenticated-orcid":false,"given":"Jie","family":"Fu","sequence":"first","affiliation":[{"name":"School of Communication and Information Engineering, Nanjing University of Posts and Telecommunications, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8105-5497","authenticated-orcid":false,"given":"Junyu","family":"Gao","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5956-831X","authenticated-orcid":false,"given":"Bing-Kun","family":"Bao","sequence":"additional","affiliation":[{"name":"School of Communication and Information Engineering, Nanjing University of Posts and Telecommunications, Nanjing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8343-9665","authenticated-orcid":false,"given":"Changsheng","family":"Xu","sequence":"additional","affiliation":[{"name":"State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018303"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3137023"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3100842"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3077512"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/tcsvt.2023.3283430"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01937"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3089323"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3201540"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/WACV51458.2022.00024"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01047"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00559"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19836-6_21"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01049"},{"key":"ref14","first-page":"1","article-title":"Into the wild with audioscope: Unsupervised audio-visual separation of on-screen sounds","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Tzinis"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00277"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01524"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01216-8_16"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00639"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i01.5361"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00406"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3127029"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413581"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58580-8_26"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01805"},{"key":"ref25","first-page":"11449","article-title":"Exploring cross-video and cross-modality signals for weakly-supervised audio-visual video parsing","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"34","author":"Lin"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19830-4_25"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/WACV45572.2020.9093438"},{"key":"ref28","article-title":"Improving multimodal accuracy through modality pre-training and attention","author":"Abdelsalam Ismail","year":"2020","journal-title":"arXiv:2011.06102"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2021.3101421"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01271"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00806"},{"key":"ref32","first-page":"1","article-title":"SoundNet: Learning sound representations from unlabeled video","volume":"29","author":"Aytar","year":"2016","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00947"},{"key":"ref34","first-page":"1","article-title":"Cooperative learning of audio and video models from self-supervised synchronization","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"31","author":"Korbar"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.73"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413869"},{"key":"ref37","first-page":"1","article-title":"Active contrastive learning of audio-visual video representations","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Ma"},{"key":"ref38","first-page":"4733","article-title":"Learning representations from audio-visual spatial alignment","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Morgado"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00194"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00110"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01231-1_39"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00458"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.450"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00900"},{"key":"ref45","article-title":"An attempt towards interpretable audio-visual video captioning","author":"Tian","year":"2018","journal-title":"arXiv:1812.02872"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00715"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00182"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01246-5_35"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/tcsvt.2023.3309899"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3203421"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3102605"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3136330"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2022.3197420"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00138"},{"key":"ref55","article-title":"Improving multi-modal learning with uni-modal teachers","author":"Du","year":"2021","journal-title":"arXiv:2106.11059"},{"key":"ref56","article-title":"Stochastic gradient descent as approximate Bayesian inference","author":"Mandt","year":"2017","journal-title":"arXiv:1704.04289"},{"key":"ref57","article-title":"Three factors influencing minima in SGD","author":"Jastrzebski","year":"2017","journal-title":"arXiv:1711.04623"},{"key":"ref58","first-page":"7164","article-title":"How does disagreement help generalization against label corruption?","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Yu"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01374"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8682847"},{"key":"ref61","article-title":"SELF: Learning to filter noisy labels with self-ensembling","author":"Tam Nguyen","year":"2019","journal-title":"arXiv:1910.01842"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00139"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683226"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547869"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2014.2336244"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00833"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00675"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952132"}],"container-title":["IEEE Transactions on Circuits and Systems for Video Technology"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/76\/10550083\/10329331.pdf?arnumber=10329331","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,6,25]],"date-time":"2024-06-25T21:19:39Z","timestamp":1719350379000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10329331\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,6]]},"references-count":69,"journal-issue":{"issue":"6"},"URL":"https:\/\/doi.org\/10.1109\/tcsvt.2023.3337134","relation":{},"ISSN":["1051-8215","1558-2205"],"issn-type":[{"value":"1051-8215","type":"print"},{"value":"1558-2205","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,6]]}}}