{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T12:07:40Z","timestamp":1784203660061,"version":"3.55.0"},"reference-count":52,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100021171","name":"Basic and Applied Basic Research Foundation of Guangdong Province","doi-asserted-by":"publisher","award":["2023A1515140109"],"award-info":[{"award-number":["2023A1515140109"]}],"id":[{"id":"10.13039\/501100021171","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62276076"],"award-info":[{"award-number":["62276076"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62176102"],"award-info":[{"award-number":["62176102"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.neucom.2026.134172","type":"journal-article","created":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T16:28:41Z","timestamp":1780417721000},"page":"134172","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["MS-TTBA: Mid\u2013side tokenized text-to-binaural audio with large language models"],"prefix":"10.1016","volume":"696","author":[{"given":"Changjun","family":"He","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lianyu","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenjie","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shiyun","family":"Xu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Weiping","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mingjiang","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.neucom.2026.134172_bib0005","series-title":"Spatial Audio","author":"Rumsey","year":"2012"},{"issue":"5","key":"10.1016\/j.neucom.2026.134172_bib0010","doi-asserted-by":"crossref","first-page":"532","DOI":"10.3390\/app7050532","article-title":"Surround by sound: a review of spatial audio recording and reproduction","volume":"7","author":"Zhang","year":"2017","journal-title":"Appl. Sci."},{"key":"10.1016\/j.neucom.2026.134172_bib0015","doi-asserted-by":"crossref","first-page":"47","DOI":"10.1051\/aacus\/2022040","article-title":"Spatial audio signal processing for binaural reproduction of recorded acoustic scenes\u2013review and challenges","volume":"6","author":"Rafaely","year":"2022","journal-title":"Acta Acust."},{"issue":"4","key":"10.1016\/j.neucom.2026.134172_bib0020","doi-asserted-by":"crossref","first-page":"553","DOI":"10.1109\/TMM.2004.827516","article-title":"Rendering localized spatial audio in a virtual auditory space","volume":"6","author":"Zotkin","year":"2004","journal-title":"IEEE Trans. Multimed."},{"issue":"3","key":"10.1016\/j.neucom.2026.134172_bib0025","doi-asserted-by":"crossref","first-page":"839","DOI":"10.1109\/TSP.2005.863030","article-title":"Bayesian regularization and nonnegative deconvolution for room impulse response estimation","volume":"54","author":"Lin","year":"2006","journal-title":"IEEE Trans. Signal Process."},{"issue":"2","key":"10.1016\/j.neucom.2026.134172_bib0030","doi-asserted-by":"crossref","first-page":"100","DOI":"10.1109\/MSP.2014.2372062","article-title":"Natural sound rendering for headphones: integration of signal processing techniques","volume":"32","author":"Jianjun","year":"2015","journal-title":"IEEE Signal Process. Mag."},{"issue":"9","key":"10.1016\/j.neucom.2026.134172_bib0035","first-page":"675","article-title":"Creating interactive virtual acoustic environments","volume":"47","author":"Savioja","year":"1999","journal-title":"J. Audio Eng. Soc."},{"key":"10.1016\/j.neucom.2026.134172_bib0040","series-title":"Audio Engineering Society Convention 148","first-page":"36","article-title":"Augmented reality for DAW-based spatial audio creation using smartphones","author":"Cassorla","year":"2020"},{"key":"10.1016\/j.neucom.2026.134172_bib0045","series-title":"International Conference on Learning Representations","first-page":"1","article-title":"Neural synthesis of binaural speech from Mono audio","author":"Richard","year":"2021"},{"key":"10.1016\/j.neucom.2026.134172_bib0050","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"324","article-title":"2.5 d visual sound","author":"Gao","year":"2019"},{"key":"10.1016\/j.neucom.2026.134172_bib0055","doi-asserted-by":"crossref","first-page":"23689","DOI":"10.52202\/068431-1721","article-title":"Binauralgrad: a two-stage conditional diffusion probabilistic model for binaural audio synthesis","volume":"35","author":"Leng","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"2","key":"10.1016\/j.neucom.2026.134172_bib0060","doi-asserted-by":"crossref","first-page":"502","DOI":"10.1109\/JAS.2023.123969","article-title":"End-to-end paired ambisonic-binaural audio rendering","volume":"11","author":"Zhu","year":"2024","journal-title":"IEEE\/CAA J. Autom. Sin."},{"key":"10.1016\/j.neucom.2026.134172_bib0065","series-title":"ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"1","article-title":"A2B: neural rendering of ambisonic recordings to binaural","author":"Gebru","year":"2025"},{"key":"10.1016\/j.neucom.2026.134172_bib0070","author":"Kreuk"},{"key":"10.1016\/j.neucom.2026.134172_bib0075","author":"Wang"},{"key":"10.1016\/j.neucom.2026.134172_bib0080","doi-asserted-by":"crossref","first-page":"47704","DOI":"10.52202\/075280-2066","article-title":"Simple and controllable music generation","volume":"36","author":"Copet","year":"2023","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.134172_bib0085","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2024.128430","article-title":"Semantic dependency and local convolution for enhancing naturalness and tone in text-to-speech synthesis","volume":"608","author":"Jiang","year":"2024","journal-title":"Neurocomputing"},{"key":"10.1016\/j.neucom.2026.134172_bib0090","series-title":"2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"1","article-title":"Stable audio open","author":"Evans","year":"2025"},{"key":"10.1016\/j.neucom.2026.134172_bib0095","author":"Liu"},{"key":"10.1016\/j.neucom.2026.134172_bib0100","series-title":"Proc. Interspeech 2025","first-page":"4228","article-title":"TTMBA: towards text to multiple sources binaural audio generation","author":"He","year":"2025"},{"key":"10.1016\/j.neucom.2026.134172_bib0105","author":"Sun"},{"key":"10.1016\/j.neucom.2026.134172_bib0110","author":"Zhao"},{"issue":"4","key":"10.1016\/j.neucom.2026.134172_bib0115","first-page":"231","article-title":"Introduction to head-related transfer functions (HRTFs): representations of HRTFs in time, frequency, and space","volume":"49","author":"Cheng","year":"2001","journal-title":"J. Audio Eng. Soc."},{"key":"10.1016\/j.neucom.2026.134172_bib0120","series-title":"Head-Related Transfer Function and Acoustic Virtual Reality","author":"Iida","year":"2019"},{"key":"10.1016\/j.neucom.2026.134172_bib0125","series-title":"2019 IEEE International Conference on Image Processing (ICIP)","first-page":"3347","article-title":"Self-supervised audio spatialization with correspondence classifier","author":"Lu","year":"2019"},{"key":"10.1016\/j.neucom.2026.134172_bib0130","series-title":"Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XII 16","first-page":"52","article-title":"Sep-stereo: visually guided stereophonic audio generation by associating source separation","author":"Zhou","year":"2020"},{"key":"10.1016\/j.neucom.2026.134172_bib0135","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"1930","article-title":"Localize to binauralize: audio spatialization from visual sound source localization","author":"Rachavarapu","year":"2021"},{"key":"10.1016\/j.neucom.2026.134172_bib0140","series-title":"Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"3347","article-title":"Beyond Mono to binaural: generating binaural audio from Mono audio with depth and cross modal attention","author":"Parida","year":"2022"},{"key":"10.1016\/j.neucom.2026.134172_bib0145","author":"Huang"},{"key":"10.1016\/j.neucom.2026.134172_bib0150","series-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"1","article-title":"Neural Fourier shift for binaural speech rendering","author":"Lee","year":"2023"},{"key":"10.1016\/j.neucom.2026.134172_bib0155","author":"Pan"},{"key":"10.1016\/j.neucom.2026.134172_bib0160","author":"Feng"},{"issue":"70","key":"10.1016\/j.neucom.2026.134172_bib0165","first-page":"1","article-title":"Scaling instruction-finetuned language models","volume":"25","author":"Chung","year":"2024","journal-title":"J. Mach. Learn. Res."},{"key":"10.1016\/j.neucom.2026.134172_bib0170","author":"Yang"},{"key":"10.1016\/j.neucom.2026.134172_bib0175","series-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"1","article-title":"Clap learning audio concepts from natural language supervision","author":"Elizalde","year":"2023"},{"key":"10.1016\/j.neucom.2026.134172_bib0180","series-title":"2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"1","article-title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","author":"Wu","year":"2023"},{"key":"10.1016\/j.neucom.2026.134172_bib0185","author":"Liu"},{"key":"10.1016\/j.neucom.2026.134172_bib0190","doi-asserted-by":"crossref","first-page":"2871","DOI":"10.1109\/TASLP.2024.3399607","article-title":"Audioldm 2: learning holistic audio generation with self-supervised pretraining","volume":"32","author":"Liu","year":"2024","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"10.1016\/j.neucom.2026.134172_bib0195","series-title":"Proceedings of the 31st ACM International Conference on Multimedia","first-page":"3590","article-title":"Text-to-audio generation using instruction guided latent diffusion model","author":"Ghosal","year":"2023"},{"key":"10.1016\/j.neucom.2026.134172_bib0200","series-title":"Proceedings of the 32nd ACM International Conference on Multimedia","first-page":"564","article-title":"Tango 2: aligning diffusion-based text-to-audio generations through direct preference optimization","author":"Majumder","year":"2024"},{"key":"10.1016\/j.neucom.2026.134172_bib0205","author":"Evans"},{"key":"10.1016\/j.neucom.2026.134172_bib0210","series-title":"ICML","first-page":"13916","article-title":"Make-an-audio: text-to-audio generation with prompt-enhanced diffusion models","author":"Huang","year":"2023"},{"key":"10.1016\/j.neucom.2026.134172_bib0215","series-title":"International Conference on Learning Representations","first-page":"1","article-title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling","author":"Ji","year":"2024"},{"key":"10.1016\/j.neucom.2026.134172_bib0220","series-title":"Proc. Interspeech 2020","first-page":"1126","article-title":"SEANet: a multi-modal speech enhancement network","author":"Tagliasacchi","year":"2020"},{"key":"10.1016\/j.neucom.2026.134172_bib0225","doi-asserted-by":"crossref","first-page":"495","DOI":"10.1109\/TASLP.2021.3129994","article-title":"Soundstream: an end-to-end neural audio codec","volume":"30","author":"Zeghidour","year":"2021","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"10.1016\/j.neucom.2026.134172_bib0230","author":"Yang"},{"key":"10.1016\/j.neucom.2026.134172_bib0235","author":"Lipman"},{"key":"10.1016\/j.neucom.2026.134172_bib0240","author":"D\u00e9fossez"},{"key":"10.1016\/j.neucom.2026.134172_bib0245","author":"Du"},{"key":"10.1016\/j.neucom.2026.134172_bib0250","author":"Kingma"},{"key":"10.1016\/j.neucom.2026.134172_bib0255","series-title":"2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"3852","article-title":"Look, listen, and learn more: design choices for deep audio embeddings","author":"Cramer","year":"2019"},{"key":"10.1016\/j.neucom.2026.134172_bib0260","author":"Koutini"}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226015705?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226015705?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T11:42:43Z","timestamp":1784202163000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0925231226015705"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":52,"alternative-id":["S0925231226015705"],"URL":"https:\/\/doi.org\/10.1016\/j.neucom.2026.134172","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"MS-TTBA: Mid\u2013side tokenized text-to-binaural audio with large language models","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neucom.2026.134172","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"134172"}}