{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,5]],"date-time":"2026-07-05T01:17:12Z","timestamp":1783214232196,"version":"3.54.6"},"reference-count":48,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100005022","name":"Beijing Jiaotong University","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100005022","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neural Networks"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.neunet.2026.109290","type":"journal-article","created":{"date-parts":[[2026,6,26]],"date-time":"2026-06-26T16:38:35Z","timestamp":1782491915000},"page":"109290","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Exploiting audio-visual modalities in videos: Object detection via multi-stage bilateral coupling network"],"prefix":"10.1016","volume":"204","author":[{"given":"Qifeng","family":"Liu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zujun","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5436-6660","authenticated-orcid":false,"given":"Liqiang","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Baoqing","family":"Guo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.neunet.2026.109290_bib0001","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"10575","article-title":"Self-supervised object detection from audio-visual correspondence","author":"Afouras","year":"2022"},{"key":"10.1016\/j.neunet.2026.109290_bib0002","series-title":"European conference on computer vision","first-page":"208","article-title":"Self-supervised learning of audio-visual objects from video","author":"Afouras","year":"2020"},{"key":"10.1016\/j.neunet.2026.109290_bib0003","series-title":"Advances in neural information processing systems","article-title":"SoundNet: Learning sound representations from unlabeled video","volume":"vol. 29","author":"Aytar","year":"2016"},{"key":"10.1016\/j.neunet.2026.109290_bib0004","series-title":"ICASSP 2024-2024 IEEE International conference on acoustics, speech and signal processing (ICASSP)","first-page":"8816","article-title":"Fusion of audio and visual embeddings for sound event localization and detection","author":"Berghi","year":"2024"},{"key":"10.1016\/j.neunet.2026.109290_bib0005","series-title":"Microphone arrays: Signal processing techniques and applications","author":"Brandstein","year":"2001"},{"key":"10.1016\/j.neunet.2026.109290_bib0006","series-title":"European conference on computer vision","first-page":"213","article-title":"End-to-end object detection with transformers","author":"Carion","year":"2020"},{"key":"10.1016\/j.neunet.2026.109290_bib0007","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"16867","article-title":"Localizing visual sounds the hard way","author":"Chen","year":"2021"},{"key":"10.1016\/j.neunet.2026.109290_bib0008","series-title":"International conference on machine learning","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","author":"Chen","year":"2020"},{"key":"10.1016\/j.neunet.2026.109290_bib0009","doi-asserted-by":"crossref","first-page":"65376","DOI":"10.1109\/ACCESS.2022.3183102","article-title":"A survey on audio-video based defect detection through deep learning in railway maintenance","volume":"10","author":"De Donato","year":"2022","journal-title":"IEEE Access"},{"issue":"6","key":"10.1016\/j.neunet.2026.109290_bib0010","doi-asserted-by":"crossref","first-page":"4106","DOI":"10.1109\/TETCI.2024.3485624","article-title":"Object-aware image augmentation for audio-visual zero-shot learning","volume":"9","author":"Dong","year":"2025","journal-title":"IEEE Transactions on Emerging Topics in Computational Intelligence"},{"issue":"2","key":"10.1016\/j.neunet.2026.109290_bib0011","doi-asserted-by":"crossref","first-page":"303","DOI":"10.1007\/s11263-009-0275-4","article-title":"The pascal visual object classes (VOC) challenge","volume":"88","author":"Everingham","year":"2010","journal-title":"International Journal of Computer Vision"},{"key":"10.1016\/j.neunet.2026.109290_bib0012","series-title":"Advances in neural information processing systems","article-title":"Learning joint statistical models for audio-visual fusion and segregation","volume":"vol. 13","author":"Fisher III","year":"2000"},{"key":"10.1016\/j.neunet.2026.109290_bib0013","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"7053","article-title":"Self-supervised moving vehicle tracking with stereo sound","author":"Gan","year":"2019"},{"issue":"6","key":"10.1016\/j.neunet.2026.109290_bib0014","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/s11227-025-07254-2","article-title":"Multi-scale feature enhanced detection of foreign object intrusions on railways","volume":"81","author":"Gao","year":"2025","journal-title":"The Journal of Supercomputing"},{"key":"10.1016\/j.neunet.2026.109290_bib0015","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"1442","article-title":"Temporal ROI align for video object recognition","volume":"vol. 35","author":"Gong","year":"2021"},{"key":"10.1016\/j.neunet.2026.109290_bib0016","series-title":"Proceedings of the IEEE\/CVF winter conference on applications of computer vision","first-page":"2185","article-title":"Complementary cues from audio help combat noise in weakly-supervised object detection","author":"Gungor","year":"2023"},{"key":"10.1016\/j.neunet.2026.109290_bib0017","series-title":"2005\u202fIEEE Computer society conference on computer vision and pattern recognition (CVPR\u201905)","first-page":"88","article-title":"Pixels that sound","volume":"vol. 1","author":"Kidron","year":"2005"},{"key":"10.1016\/j.neunet.2026.109290_bib0018","series-title":"ICASSP 2023-2023 IEEE International conference on acoustics, speech and signal processing (ICASSP)","first-page":"1","article-title":"Towards robust audio-based vehicle detection via importance-aware audio-visual learning","author":"Kim","year":"2023"},{"issue":"1","key":"10.1016\/j.neunet.2026.109290_bib0019","doi-asserted-by":"crossref","first-page":"341","DOI":"10.1109\/TNNLS.2023.3323560","article-title":"Enabling visual object detection with object sounds via visual modality recalling memory","volume":"36","author":"Kim","year":"2025","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"10.1016\/j.neunet.2026.109290_bib0020","series-title":"European conference on computer vision","first-page":"740","article-title":"Microsoft coco: Common objects in context","author":"Lin","year":"2014"},{"issue":"1","key":"10.1016\/j.neunet.2026.109290_bib0021","doi-asserted-by":"crossref","first-page":"50","DOI":"10.23939\/acps2023.01.050","article-title":"Development of a video surveillance system for motion detection and object recognition","volume":"8","author":"Lys","year":"2023","journal-title":"Advances in Cyber-Physical Systems"},{"key":"10.1016\/j.neunet.2026.109290_bib0022","series-title":"European conference on computer vision","first-page":"218","article-title":"Localizing visual sounds the easy way","author":"Mo","year":"2022"},{"key":"10.1016\/j.neunet.2026.109290_bib0023","series-title":"European conference on computer vision","first-page":"292","article-title":"Multiple sound sources localization from coarse to fine","author":"Qian","year":"2020"},{"key":"10.1016\/j.neunet.2026.109290_bib0024","doi-asserted-by":"crossref","first-page":"550","DOI":"10.1109\/TASLP.2022.3226330","article-title":"Audio-visual cross-attention network for robotic speaker tracking","volume":"31","author":"Qian","year":"2022","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing"},{"issue":"2","key":"10.1016\/j.neunet.2026.109290_bib0025","doi-asserted-by":"crossref","first-page":"617","DOI":"10.1016\/S0896-6273(00)00138-0","article-title":"Audiovisual integration of letters in the human brain","volume":"28","author":"Raij","year":"2000","journal-title":"Neuron"},{"key":"10.1016\/j.neunet.2026.109290_bib0026","series-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","first-page":"779","article-title":"You only look once: Unified, real-time object detection","author":"Redmon","year":"2016"},{"key":"10.1016\/j.neunet.2026.109290_bib0027","series-title":"Advances in neural information processing systems","article-title":"Faster r-CNN: Towards real-time object detection with region proposal networks","volume":"vol. 28","author":"Ren","year":"2015"},{"issue":"3","key":"10.1016\/j.neunet.2026.109290_bib0028","doi-asserted-by":"crossref","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","article-title":"Imagenet large scale visual recognition challenge","volume":"115","author":"Russakovsky","year":"2015","journal-title":"International Journal of Computer Vision"},{"key":"10.1016\/j.neunet.2026.109290_bib0029","series-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","first-page":"4358","article-title":"Learning to localize sound source in visual scenes","author":"Senocak","year":"2018"},{"key":"10.1016\/j.neunet.2026.109290_bib0030","series-title":"ICASSP 2022-2022 IEEE International conference on acoustics, speech and signal processing (ICASSP)","first-page":"4863","article-title":"Learning sound localization better from semantically similar samples","author":"Senocak","year":"2022"},{"key":"10.1016\/j.neunet.2026.109290_bib0031","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"2254","article-title":"YOLOv: Making still image object detectors great at video object detection","volume":"vol. 37","author":"Shi","year":"2023"},{"key":"10.1016\/j.neunet.2026.109290_bib0032","series-title":"2023 9th International conference on computer and communications (ICCC)","first-page":"2412","article-title":"Self-supervised object detection network from sound cues based on knowledge distillation with multimodal cross level feature alignment","author":"Shibei","year":"2023"},{"key":"10.1016\/j.neunet.2026.109290_bib0033","doi-asserted-by":"crossref","first-page":"2650","DOI":"10.1109\/TMM.2025.3535359","article-title":"Listen with seeing: Cross-modal contrastive learning for audio-visual event localization","volume":"27","author":"Sun","year":"2025","journal-title":"IEEE Transactions on Multimedia"},{"key":"10.1016\/j.neunet.2026.109290_bib0034","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"10781","article-title":"EfficientDet: Scalable and efficient object detection","author":"Tan","year":"2020"},{"key":"10.1016\/j.neunet.2026.109290_bib0035","series-title":"Proceedings of the European conference on computer vision (ECCV)","first-page":"247","article-title":"Audio-visual event localization in unconstrained videos","author":"Tian","year":"2018"},{"key":"10.1016\/j.neunet.2026.109290_bib0036","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"11612","article-title":"There is more than meets the eye: Self-supervised multi-object detection and tracking with sound by distilling multimodal knowledge","author":"Valverde","year":"2021"},{"issue":"21","key":"10.1016\/j.neunet.2026.109290_bib0037","doi-asserted-by":"crossref","first-page":"7279","DOI":"10.3390\/s21217279","article-title":"A fast intrusion detection method for high-speed railway clearance based on low-cost embedded GPUs","volume":"21","author":"Wang","year":"2021","journal-title":"Sensors"},{"key":"10.1016\/j.neunet.2026.109290_bib0038","series-title":"Proceedings of the IEEE\/CVF international conference on computer vision","first-page":"9217","article-title":"Sequence level semantics aggregation for video object detection","author":"Wu","year":"2019"},{"key":"10.1016\/j.neunet.2026.109290_bib0039","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"6441","article-title":"CASP-Net: Rethinking video saliency prediction from an audio-visual consistency perceptual perspective","author":"Xiong","year":"2023"},{"key":"10.1016\/j.neunet.2026.109290_bib0040","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"27273","article-title":"DiffSal: Joint audio and video learning for diffusion saliency prediction","author":"Xiong","year":"2024"},{"key":"10.1016\/j.neunet.2026.109290_bib0041","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2025.127638","article-title":"IllumiNet: A two-stage model for effective flare removal and light enhancement under complex lighting conditions","volume":"282","author":"Xu","year":"2025","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.neunet.2026.109290_bib0042","unstructured":"Yu, L., Sun, X., Gao, P., & Gabbouj, M. (2024). Relevance-guided audio visual fusion for video saliency prediction. arXiv: 2411.11454."},{"key":"10.1016\/j.neunet.2026.109290_bib0043","series-title":"Proceedings of the European conference on computer vision (ECCV)","first-page":"570","article-title":"The sound of pixels","author":"Zhao","year":"2018"},{"key":"10.1016\/j.neunet.2026.109290_bib0044","unstructured":"Zhou, X., Wang, D., & Kr\u00e4henb\u00fchl, P. (2019). Objects as points. arXiv: 1904.07850."},{"issue":"3","key":"10.1016\/j.neunet.2026.109290_bib0045","doi-asserted-by":"crossref","first-page":"351","DOI":"10.1007\/s11633-021-1293-0","article-title":"Deep audio-visual learning: A survey","volume":"18","author":"Zhu","year":"2021","journal-title":"International Journal of Automation and Computing"},{"key":"10.1016\/j.neunet.2026.109290_bib0046","series-title":"Proceedings of the IEEE international conference on computer vision","first-page":"408","article-title":"Flow-guided feature aggregation for video object detection","author":"Zhu","year":"2017"},{"key":"10.1016\/j.neunet.2026.109290_bib0047","series-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","first-page":"2349","article-title":"Deep feature flow for video recognition","author":"Zhu","year":"2017"},{"issue":"3","key":"10.1016\/j.neunet.2026.109290_bib0048","doi-asserted-by":"crossref","first-page":"257","DOI":"10.1109\/JPROC.2023.3238524","article-title":"Object detection in 20 years: A survey","volume":"111","author":"Zou","year":"2023","journal-title":"Proceedings of the IEEE"}],"container-title":["Neural Networks"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0893608026007501?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0893608026007501?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,5]],"date-time":"2026-07-05T00:48:41Z","timestamp":1783212521000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0893608026007501"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":48,"alternative-id":["S0893608026007501"],"URL":"https:\/\/doi.org\/10.1016\/j.neunet.2026.109290","relation":{},"ISSN":["0893-6080"],"issn-type":[{"value":"0893-6080","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Exploiting audio-visual modalities in videos: Object detection via multi-stage bilateral coupling network","name":"articletitle","label":"Article Title"},{"value":"Neural Networks","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neunet.2026.109290","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"109290"}}