{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,11]],"date-time":"2025-11-11T05:58:50Z","timestamp":1762840730211,"version":"build-2065373602"},"reference-count":48,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2025]]},"DOI":"10.1109\/access.2025.3628289","type":"journal-article","created":{"date-parts":[[2025,11,3]],"date-time":"2025-11-03T18:45:59Z","timestamp":1762195559000},"page":"189713-189724","source":"Crossref","is-referenced-by-count":0,"title":["Nanami: Hybrid Embedding With Voice Large Language Models for Audio Retrieval"],"prefix":"10.1109","volume":"13","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-4538-6195","authenticated-orcid":false,"given":"Gaojun","family":"Hu","sequence":"first","affiliation":[{"name":"The People&#x2019;s Hospital of Danyang, Affiliated Danyang Hospital of Nantong University, Danyang, Jiangsu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095889"},{"key":"ref2","article-title":"Natural language supervision for general-purpose audio representations","author":"Elizalde","year":"2023","journal-title":"arXiv:2309.05767"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095969"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2024.3419446"},{"key":"ref5","article-title":"AudioSetCaps: An enriched audio-caption dataset using automated generation pipeline with large audio and language models","author":"Bai","year":"2024","journal-title":"arXiv:2411.18953"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3681472"},{"key":"ref7","article-title":"Estimated audio-caption correspondences improve language-based audio retrieval","author":"Primus","year":"2024","journal-title":"arXiv:2408.11641"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.90"},{"key":"ref9","article-title":"MetaMorph: Multimodal understanding and generation via instruction tuning","author":"Tong","year":"2024","journal-title":"arXiv:2412.14164"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1186\/s40537-021-00444-8"},{"key":"ref11","article-title":"Resnet in resnet: Generalizing residual architectures","author":"Targ","year":"2016","journal-title":"arXiv:1603.08029"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2016.2582924"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.3030497"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-97-3245-6_5"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9746312"},{"key":"ref16","first-page":"63197","article-title":"CoLLAT: On adding fine-grained audio understanding to language models using token-level locked-language tuning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"36","author":"Silva"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10448486"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2025-159"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2025-908"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2023.3288409"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2024.3399607"},{"key":"ref22","article-title":"MusicLM: Generating music from text","author":"Agostinelli","year":"2023","journal-title":"arXiv:2301.11325"},{"key":"ref23","article-title":"SpeechT5: Unified-modal encoder\u2013decoder pre-training for spoken language processing","author":"Ao","year":"2021","journal-title":"arXiv:2110.07205"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2012.291"},{"key":"ref25","first-page":"12449","article-title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Baevski"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.3362\/0262-8104.2002.009"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2021-1965"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.135"},{"key":"ref29","article-title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","author":"Chu","year":"2023","journal-title":"arXiv:2311.07919"},{"key":"ref30","article-title":"Qwen2-audio technical report","volume-title":"arXiv:2407.10759","author":"Chu","year":"2024"},{"key":"ref31","article-title":"SALMONN: Towards generic hearing abilities for large language models","author":"Tang","year":"2023","journal-title":"arXiv:2310.13289"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9052990"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.21437\/GLU.2017-9"},{"key":"ref34","first-page":"119","article-title":"Audiocaps: Generating captions for audios in the wild","volume-title":"Proc. 2019 Conf. North Amer. Chapter Assoc. Comput. Linguistics, Human Lang. Technol.","volume":"1","author":"Kim"},{"key":"ref35","article-title":"Adversarial NLI: A new benchmark for natural language understanding","author":"Nie","year":"2019","journal-title":"arXiv:1910.14599"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.181"},{"key":"ref37","article-title":"MM-embed: Universal multimodal retrieval with multimodal LLMs","author":"Lin","year":"2024","journal-title":"arXiv:2411.02571"},{"key":"ref38","article-title":"LLM2CLIP: Powerful language model unlocks richer visual representation","author":"Huang","year":"2024","journal-title":"arXiv:2411.04997"},{"key":"ref39","article-title":"A survey of multimodal retrieval-augmented generation","author":"Mei","year":"2025","journal-title":"arXiv:2504.08748"},{"key":"ref40","article-title":"Sparse meets dense: Unified generative recommendations with cascaded sparse-dense representations","author":"Yang","year":"2025","journal-title":"arXiv:2503.02453"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.250"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.3115\/1225403.1225421"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1145\/3404835.3463098"},{"key":"ref44","article-title":"Audio flamingo 3: Advancing audio intelligence with fully open large audio language models","author":"Goel","year":"2025","journal-title":"arXiv:2507.08128"},{"key":"ref45","article-title":"Smarter, better, faster, longer: A modern bidirectional encoder for fast, memory efficient, and long context finetuning and inference","author":"Warner","year":"2024","journal-title":"arXiv:2412.13663"},{"key":"ref46","article-title":"Qwen3-omni technical report","volume-title":"arXiv:2509.17765","author":"Xu","year":"2025"},{"key":"ref47","first-page":"10088","article-title":"QLoRA: Efficient finetuning of quantized LLMs","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Dettmers"},{"key":"ref48","first-page":"17612","article-title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Liang"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/10820123\/11224486.pdf?arnumber=11224486","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,11]],"date-time":"2025-11-11T05:55:28Z","timestamp":1762840528000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11224486\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"references-count":48,"URL":"https:\/\/doi.org\/10.1109\/access.2025.3628289","relation":{},"ISSN":["2169-3536"],"issn-type":[{"type":"electronic","value":"2169-3536"}],"subject":[],"published":{"date-parts":[[2025]]}}}