{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,17]],"date-time":"2025-10-17T14:19:33Z","timestamp":1760710773677,"version":"3.37.3"},"reference-count":46,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T00:00:00Z","timestamp":1634515200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T00:00:00Z","timestamp":1634515200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key R&D Program of China","doi-asserted-by":"crossref","award":["2017YFB1002803","2017YFB1002803"],"award-info":[{"award-number":["2017YFB1002803","2017YFB1002803"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100012166","name":"National Key R&D Program of China","doi-asserted-by":"crossref","award":["2017YFB1002803"],"award-info":[{"award-number":["2017YFB1002803"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100001809","name":"National Nature Science Foundation of China","doi-asserted-by":"crossref","award":["U1803262"],"award-info":[{"award-number":["U1803262"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Basic Research Project of Science and Technology Plan of Shenzhen","award":["JCYJ20170818143246278"],"award-info":[{"award-number":["JCYJ20170818143246278"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Process Lett"],"published-print":{"date-parts":[[2022,4]]},"DOI":"10.1007\/s11063-021-10659-8","type":"journal-article","created":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T07:41:50Z","timestamp":1634542910000},"page":"817-833","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["High Parameter Frequency Resolution Encoding Scheme for Spatial Audio Objects Using Stacked Sparse Autoencoder"],"prefix":"10.1007","volume":"54","author":[{"given":"Yulin","family":"Wu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5872-3872","authenticated-orcid":false,"given":"Ruimin","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaochen","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chenhao","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shanfa","family":"Ke","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,10,18]]},"reference":[{"issue":"6","key":"10659_CR1","doi-asserted-by":"publisher","first-page":"1467","DOI":"10.1109\/TASL.2010.2092429","volume":"19","author":"A Ando","year":"2011","unstructured":"Ando A (2011) Conversion of multichannel sound signal maintaining physical properties of sound in reproduced sound field. IEEE Transactions Audio Speech Lang Process 19(6):1467\u20131475","journal-title":"IEEE Transactions Audio Speech Lang Process"},{"key":"10659_CR2","doi-asserted-by":"crossref","unstructured":"Antoine L, Fabian-Robert S, Zafar R, Daichi K, Bertrand R, Nobutaka I, Nobutaka O, Julie F (2017) The 2016 signal separation evaluation campaign. In: Latent Variable Analysis and Signal Separation - 12th International Conference, Springer International Publishing, pp 323\u2013332","DOI":"10.1007\/978-3-319-53547-0_31"},{"key":"10659_CR3","doi-asserted-by":"crossref","unstructured":"Arteaga D, Pons J (2021) Multichannel-based learning for audio object extraction. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 206\u2013210","DOI":"10.1109\/ICASSP39728.2021.9414585"},{"key":"10659_CR4","volume-title":"Introduction to digital audio coding and standards","author":"M Bosi","year":"2012","unstructured":"Bosi M, Goldberg RE (2012) Introduction to digital audio coding and standards, vol 721. Springer, New York"},{"issue":"10","key":"10659_CR5","first-page":"789","volume":"45","author":"M Bosi","year":"1997","unstructured":"Bosi M, Brandenburg K, Quackenbush S, Fielder L, Akagiri K, Fuchs H, Dietz M, Herre J, Davidson G, Oikawa Y (1997) ISO\/IEC MPEG-2 advanced audio coding. Audio Eng Soc (AES) 45(10):789\u2013814","journal-title":"Audio Eng Soc (AES)"},{"key":"10659_CR6","unstructured":"Dolby Laboratories (2015) Dolby Atmos for the Home Theater. [Available]: http:\/\/www.dolby.com\/us\/en\/technologies\/dolby-atmos\/dolby-atmos-for-the-home-theater.pdf"},{"key":"10659_CR7","unstructured":"Dolby Laboratories (2016) Dolby Atmos. [Available]: http:\/\/www.dolby.com\/us\/en\/brands\/dolby-atmos.html"},{"key":"10659_CR8","doi-asserted-by":"crossref","unstructured":"Elfitri I, Muharam M, Shobirin M (2014) Distortion analysis of hierarchical mixing technique on MPEG surround standard. In: International Conference on Advanced Computer Science and Information System, pp 396\u2013400","DOI":"10.1109\/ICACSIS.2014.7065868"},{"issue":"6","key":"10659_CR9","doi-asserted-by":"publisher","first-page":"520","DOI":"10.1109\/TSA.2003.818108","volume":"11","author":"C Faller","year":"2003","unstructured":"Faller C, Baumgarte F (2003) Binaural cue coding-part II: schemes and applications. IEEE Transactions Speech Audio Process 11(6):520\u2013531","journal-title":"IEEE Transactions Speech Audio Process"},{"key":"10659_CR10","unstructured":"F\u00e9votte C, Gribonval R, Vincent E (2005) BSS\\_EVAL toolbox user guide\u2013Revision 2.0"},{"issue":"2","key":"10659_CR11","doi-asserted-by":"publisher","first-page":"2157","DOI":"10.1007\/s11042-018-6273-1","volume":"78","author":"M Gnouma","year":"2019","unstructured":"Gnouma M, Ladjailia A, Ejbali R, Zaied M (2019) Stacked sparse autoencoder and history of binary motion image for human activity recognition. Multimedia Tools Appl 78(2):2157\u20132179","journal-title":"Multimedia Tools Appl"},{"key":"10659_CR12","doi-asserted-by":"crossref","unstructured":"Herre J, Disch S (2007) New concepts in parametric coding of spatial audio: from SAC to SAOC. In: IEEE International Conference on Multimedia and Expo (ICME), pp 1894\u20131897","DOI":"10.1109\/ICME.2007.4285045"},{"issue":"9","key":"10659_CR13","first-page":"655","volume":"60","author":"J Herre","year":"2012","unstructured":"Herre J, Purnhagen H, Koppens J, Hellmuth O, Engdegard J, Hilpert J, Villemoes L, Terentiv L, Falch C, Holzer A, Valero ML, Resch B, Mundt H, Oh HO (2012) MPEG spatial audio object coding-The ISO\/MPEG standard for efficient coding of interactive audio scenes. Audio Eng Soc (AES) 60(9):655\u2013673","journal-title":"Audio Eng Soc (AES)"},{"issue":"5","key":"10659_CR14","doi-asserted-by":"publisher","first-page":"770","DOI":"10.1109\/JSTSP.2015.2411578","volume":"9","author":"J Herre","year":"2015","unstructured":"Herre J, Hilpert J, Kuntz A, Plogsties J (2015a) MPEG-H 3D audio-the new standard for coding of immersive spatial audio. IEEE J Sel Topics Signal Process 9(5):770\u2013779","journal-title":"IEEE J Sel Topics Signal Process"},{"issue":"12","key":"10659_CR15","doi-asserted-by":"publisher","first-page":"821","DOI":"10.17743\/jaes.2014.0049","volume":"62","author":"J Herre","year":"2015","unstructured":"Herre J, Hilpert J, Kuntz A, Plogsties J (2015b) MPEG-H audio-the new standard for universal spatial\/3D audio coding. Audio Eng Soc (AES) 62(12):821\u2013830","journal-title":"Audio Eng Soc (AES)"},{"key":"10659_CR16","doi-asserted-by":"crossref","unstructured":"Hu C, Hu R, Wang X, Wu T, Li D (2020) Multi-step coding structure of spatial audio object coding. In: International Conference on Multimedia Modeling, pp 666\u2013678","DOI":"10.1007\/978-3-030-37731-1_54"},{"key":"10659_CR17","doi-asserted-by":"crossref","unstructured":"Hu C, Hu R, Wang X, Wu Y (2021a) Spatial audio object coding based on time-frequency shifting and scheduling. In: IEEE International Conference on Multimedia and Expo (ICME), pp 1\u20136","DOI":"10.1109\/ICME51207.2021.9428297"},{"key":"10659_CR18","doi-asserted-by":"crossref","unstructured":"Hu C, Hu R, Wang X, Wu Y, Liu W (2021b) Efficient multi-step audio object coding with limited residual information. In: IEEE International Conference on Multimedia and Expo (ICME), pp 1\u20136","DOI":"10.1109\/ICME51207.2021.9428471"},{"issue":"12","key":"10659_CR19","doi-asserted-by":"publisher","first-page":"18717","DOI":"10.1007\/s11042-020-10339-0","volume":"80","author":"C Hu","year":"2021","unstructured":"Hu C, Wang X, Hu R, Wu Y (2021) Audio object coding based on n-step residual compensating. Multimedia Tools Appl 80(12):18717\u201318733","journal-title":"Multimedia Tools Appl"},{"key":"10659_CR20","unstructured":"ISO\/IEC 23003-2 (2018) Information technology \u2014- MPEG audio technologies \u2014- Part 2: Spatial Audio Object Coding (SAOC)"},{"key":"10659_CR21","unstructured":"ISO\/IEC 23008-3 (2019) Information technology \u2014- High efficiency coding and media delivery in heterogeneous environments \u2014- Part 3: 3D audio"},{"issue":"6","key":"10659_CR22","doi-asserted-by":"publisher","first-page":"1082","DOI":"10.1109\/TASLP.2015.2419980","volume":"23","author":"M Jia","year":"2015","unstructured":"Jia M, Yang Z, Bao C, Zheng X, Ritz C (2015) Encoding multiple audio objects using intra-object sparsity. IEEE\/ACM Transactions Audio Speech Lang Process 23(6):1082\u20131095","journal-title":"IEEE\/ACM Transactions Audio Speech Lang Process"},{"issue":"12","key":"10659_CR23","doi-asserted-by":"publisher","first-page":"1301","DOI":"10.3390\/app7121301","volume":"7","author":"M Jia","year":"2017","unstructured":"Jia M, Zhang J, Bao C, Zheng X (2017) A psychoacoustic-based multiple audio object coding approach via intra-object sparsity. Appl Sci 7(12):1301\u20131312","journal-title":"Appl Sci"},{"key":"10659_CR24","doi-asserted-by":"crossref","unstructured":"Kadam VJ, Jadhav SM, Kurdukar AA, Shirsath MR (2020) Arrhythmia classification using feature ensemble learning based on stacked sparse autoencoders with GA-SVM guided features. In: International Conference on Industry 4.0 Technology (I4Tech), pp 94\u201399","DOI":"10.1109\/I4Tech48345.2020.9102675"},{"issue":"6","key":"10659_CR25","doi-asserted-by":"publisher","first-page":"1208","DOI":"10.1109\/TMM.2011.2168197","volume":"13","author":"K Kim","year":"2011","unstructured":"Kim K, Seo J, Beack S, Kang K, Hahn M (2011) Spatial audio object coding with two-step coding structure for interactive audio service. IEEE Transactions Multimedia 13(6):1208\u20131216","journal-title":"IEEE Transactions Multimedia"},{"key":"10659_CR26","doi-asserted-by":"publisher","first-page":"107003","DOI":"10.1016\/j.asoc.2020.107003","volume":"101","author":"Y Li","year":"2021","unstructured":"Li Y, Lei Y, Wang P, Jiang M, Liu Y (2021) Embedded stacked group sparse autoencoder ensemble with L1 regularization and manifold reduction. Appl Soft Comput 101:107003","journal-title":"Appl Soft Comput"},{"key":"10659_CR27","unstructured":"Murtaza A, Herre J, Paulus J, Terentiv L, Fuchs H, Disch S (2015) ISO\/MPEG-H 3D audio: SAOC 3D decoding and rendering. In: Audio Engineering Society (AES) Convention 139"},{"key":"10659_CR28","unstructured":"Purnhagen H, Hirvonen T, Villemoes L, Samuelsson J, Klejsa J (2016) Immersive audio delivery using joint object coding. In: Audio Engineering Society (AES) Convention 140"},{"key":"10659_CR29","unstructured":"Recommendation ITU-R BS1534-3 (2015) Method for the subjective assessment of intermediate quality level of audio systems. International Telecommunication Union Radiocommunication Assembly"},{"key":"10659_CR30","doi-asserted-by":"crossref","unstructured":"Rohlfing C, ECohen J, Liutkus A (2017) Very low bitrate spatial audio coding with dimensionality reduction. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 741\u2013745","DOI":"10.1109\/ICASSP.2017.7952254"},{"issue":"8","key":"10659_CR31","doi-asserted-by":"publisher","first-page":"5150","DOI":"10.1109\/TII.2019.2949355","volume":"16","author":"C Shi","year":"2020","unstructured":"Shi C, Luo B, He S, Li K, Liu H, Li B (2020) Tool wear prediction via multidimensional stacked sparse autoencoders with feature fusion. IEEE Transactions Ind Inform 16(8):5150\u20135159","journal-title":"IEEE Transactions Ind Inform"},{"key":"10659_CR32","doi-asserted-by":"crossref","unstructured":"Villemoes L, Hirvonen T, Purnhagen H (2017) Decorrelation for audio object coding. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 706\u2013710","DOI":"10.1109\/ICASSP.2017.7952247"},{"issue":"4","key":"10659_CR33","doi-asserted-by":"publisher","first-page":"1462","DOI":"10.1109\/TSA.2005.858005","volume":"14","author":"E Vincent","year":"2006","unstructured":"Vincent E, Gribonval R, F\u00e9votte C (2006) Performance measurement in blind audio source separation. IEEE Transactions Audio Speech Lang Process 14(4):1462\u20131469","journal-title":"IEEE Transactions Audio Speech Lang Process"},{"key":"10659_CR34","doi-asserted-by":"publisher","first-page":"232","DOI":"10.1016\/j.neucom.2015.08.104","volume":"184","author":"Y Wang","year":"2016","unstructured":"Wang Y, Yao H, Zhao S (2016) Auto-encoder based dimensionality reduction. Neurocomputing 184:232\u2013242","journal-title":"Neurocomputing"},{"issue":"9","key":"10659_CR35","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1109\/CC.2017.8068762","volume":"14","author":"T Wu","year":"2017","unstructured":"Wu T, Hu R, Wang X, Ke S, Wang J (2017) High quality audio object coding framework based on non-negative matrix factorization. China Commun 14(9):32\u201341","journal-title":"China Commun"},{"issue":"15","key":"10659_CR36","doi-asserted-by":"publisher","first-page":"20723","DOI":"10.1007\/s11042-019-7409-7","volume":"78","author":"T Wu","year":"2019","unstructured":"Wu T, Hu R, Wang X, Ke S (2019) Audio object coding based on optimal parameter frequency resolution. Multimedia Tools Appl 78(15):20723\u201320738","journal-title":"Multimedia Tools Appl"},{"key":"10659_CR37","doi-asserted-by":"crossref","unstructured":"Wu Y, Hu R, Hu C, Ke S, Li G, Wang X (2021a) Low bitrates audio object coding using convolutional auto-encoder and densenet mixture model. In: IEEE International Conference on Multimedia and Expo (ICME), pp 1\u20136","DOI":"10.1109\/ICME51207.2021.9428227"},{"key":"10659_CR38","doi-asserted-by":"crossref","unstructured":"Wu Y, Hu R, Wang X, Hu C, Li G (2021b) Stacked sparse autoencoder for audio object coding. In: International Conference on Multimedia Modeling (MMM), pp 50\u201361","DOI":"10.1007\/978-3-030-67832-6_5"},{"key":"10659_CR39","doi-asserted-by":"crossref","unstructured":"Yang F, Herranz L, Cheng Y, Mozerov MG (2021) Slimmable compressive autoencoders for practical neural image compression. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp 4998\u20135007","DOI":"10.1109\/CVPR46437.2021.00496"},{"key":"10659_CR40","doi-asserted-by":"crossref","unstructured":"Yang Z, Jia M, Bao C, Wang W (2015a) An analysis-by-synthesis encoding approach for multiple audio objects. In: Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA), pp 59\u201362","DOI":"10.1109\/APSIPA.2015.7415383"},{"issue":"6","key":"10659_CR41","doi-asserted-by":"publisher","first-page":"135","DOI":"10.1515\/cait-2015-0074","volume":"15","author":"Z Yang","year":"2015","unstructured":"Yang Z, Jia M, Wang W, Zhang J (2015b) Multi-stage encoding scheme for multiple audio objects using compressed sensing. Cybern Information Technol 15(6):135\u2013146","journal-title":"Cybern Information Technol"},{"key":"10659_CR42","doi-asserted-by":"publisher","unstructured":"Yu M, Quan T, Peng Q, Yu X, Liu L (2021) A model-based collaborate filtering algorithm based on stacked AutoEncoder. Neural Comput Appl. https:\/\/doi.org\/10.1007\/s00521-021-05933-8","DOI":"10.1007\/s00521-021-05933-8"},{"key":"10659_CR43","doi-asserted-by":"crossref","unstructured":"Zhang Q, Zhou J, Zhang B (2020) A noninvasive method to detect diabetes mellitus and lung cancer using the stacked sparse autoencoder. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 1409\u20131413","DOI":"10.1109\/ICASSP40776.2020.9054412"},{"key":"10659_CR44","unstructured":"Zhang S, Wu X, Qu T (2019) Sparse autoencoder based multiple audio objects coding method. In: Audio Engineering Society (AES) Convention 146"},{"issue":"1","key":"10659_CR45","doi-asserted-by":"publisher","first-page":"29","DOI":"10.1109\/TASL.2012.2211015","volume":"21","author":"X Zheng","year":"2013","unstructured":"Zheng X, Ritz C, Xi J (2013) Encoding navigable speech sources: a psychoacoustic-based analysis-by-synthesis approach. IEEE Transactions Audio Speech Lang Process 21(1):29\u201338","journal-title":"IEEE Transactions Audio Speech Lang Process"},{"key":"10659_CR46","doi-asserted-by":"crossref","unstructured":"Zheng X, Ritz C, Xi J (2013b) A psychoacoustic-based analysis-by-synthesis scheme for jointly encoding multiple audio objects into independent mixtures. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 281\u2013285","DOI":"10.1109\/ICASSP.2013.6637653"}],"container-title":["Neural Processing Letters"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11063-021-10659-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11063-021-10659-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11063-021-10659-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,4,9]],"date-time":"2022-04-09T17:06:44Z","timestamp":1649524004000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11063-021-10659-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,18]]},"references-count":46,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2022,4]]}},"alternative-id":["10659"],"URL":"https:\/\/doi.org\/10.1007\/s11063-021-10659-8","relation":{},"ISSN":["1370-4621","1573-773X"],"issn-type":[{"type":"print","value":"1370-4621"},{"type":"electronic","value":"1573-773X"}],"subject":[],"published":{"date-parts":[[2021,10,18]]},"assertion":[{"value":"6 October 2021","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 October 2021","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}