{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,4,5]],"date-time":"2025-04-05T10:40:05Z","timestamp":1743849605890,"version":"3.40.3"},"reference-count":50,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2012,7,26]],"date-time":"2012-07-26T00:00:00Z","timestamp":1343260800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2013,7]]},"DOI":"10.1007\/s00530-012-0289-6","type":"journal-article","created":{"date-parts":[[2012,7,25]],"date-time":"2012-07-25T01:02:40Z","timestamp":1343178160000},"page":"359-380","source":"Crossref","is-referenced-by-count":4,"title":["Adaptive music resizing with stretching, cropping and insertion"],"prefix":"10.1007","volume":"19","author":[{"given":"Zhang","family":"Liu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chaokun","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianmin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yiyuan","family":"Bai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2012,7,26]]},"reference":[{"key":"289_CR1","unstructured":"Methods for the subjective assessment of small impairments in audio systems including multichannel sound systems. ITU Recommendation BS.1116-1 (1994)"},{"key":"289_CR2","unstructured":"General methods for the subjective assessment of sound quality. ITU Recommendation BS.1284-1 (1997)"},{"issue":"2\u20133","key":"289_CR3","doi-asserted-by":"crossref","first-page":"485","DOI":"10.1007\/s10994-006-0586-4","volume":"65","author":"A. Abdallah","year":"2006","unstructured":"Abdallah, A., Sandler, B., Rhodes, C., Casey, M.: Using duration models to reduce fragmentation in audio segmentation. Mach. Learn. 65(2\u20133), 485\u2013515 (2006)","journal-title":"Mach. Learn."},{"key":"289_CR4","doi-asserted-by":"crossref","unstructured":"Anh, N.T.N., Yang, W., Cai, J.: Seam carving extension: a compression perspective. In: ACM Multimedia, pp. 825\u2013828 (2009)","DOI":"10.1145\/1631272.1631424"},{"issue":"3","key":"289_CR5","doi-asserted-by":"crossref","first-page":"10","DOI":"10.1145\/1276377.1276390","volume":"26","author":"S. Avidan","year":"2007","unstructured":"Avidan, S., Shamir, A.: Seam carving for content-aware image resizing. ACM Trans. Graph. 26(3), 10 (2007)","journal-title":"ACM Trans. Graph."},{"issue":"3","key":"289_CR6","doi-asserted-by":"crossref","first-page":"602","DOI":"10.1109\/TASL.2009.2036306","volume":"18","author":"L. Barrington","year":"2010","unstructured":"Barrington, L., Chan, A., Lanckriet, G.: Modeling music as a dynamic texture. IEEE Trans. Audio Speech Lang. Process. 18(3), 602\u2013612 (2010)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"issue":"1","key":"289_CR7","doi-asserted-by":"crossref","first-page":"96","DOI":"10.1109\/TMM.2004.840597","volume":"7","author":"M.A. Bartsch","year":"2005","unstructured":"Bartsch, M.A., Wakefield, G.H.: Audio thumbnailing of popular music using chroma-based representations. IEEE Trans. Multimed. 7(1), 96\u2013104 (2005)","journal-title":"IEEE Trans. Multimed."},{"key":"289_CR8","doi-asserted-by":"crossref","first-page":"309","DOI":"10.1038\/35002078","volume":"403","author":"P. Belin","year":"2000","unstructured":"Belin, P., Zatorre, R.J., Lafaille, P., Ahad, P., Pike, B.: Voice-selective areas in human auditory cortex. Nature 403, 309\u2013312 (2000)","journal-title":"Nature"},{"issue":"5","key":"289_CR9","doi-asserted-by":"crossref","first-page":"1035","DOI":"10.1109\/TSA.2005.851998","volume":"13","author":"J.P. Bello","year":"2005","unstructured":"Bello, J.P., Daudet, L., Abdallah, S.A., Duxbury, C., Davies, M.E., Sandler, M.B.: A tutorial on onset detection in music signals. IEEE Trans. Speech Audio Process. 13(5), 1035\u20131047 (2005)","journal-title":"IEEE Trans. Speech Audio Process."},{"issue":"3","key":"289_CR10","doi-asserted-by":"crossref","first-page":"102","DOI":"10.1145\/1276377.1276505","volume":"26","author":"E.P. Bennett","year":"2007","unstructured":"Bennett, E.P., McMillan, L.: Computational time-lapse video. ACM Trans. Graph. 26(3), 102 (2007)","journal-title":"ACM Trans. Graph."},{"key":"289_CR11","doi-asserted-by":"crossref","unstructured":"Burges, C.J.C., Plastina, D., Platt, J.C., Renshaw, E., Malvar, H.S.: Using audio fingerprinting for duplicate detection and thumbnail generation. In: IEEE ICASSP, pp. 9\u201312 (2005)","DOI":"10.1109\/ICASSP.2005.1415633"},{"key":"289_CR12","doi-asserted-by":"crossref","unstructured":"Chai, W., Vercoe, B.: Music thumbnailing via structural analysis. In: ACM Multimedia, pp. 223\u2013226 (2003)","DOI":"10.1145\/957013.957057"},{"key":"289_CR13","unstructured":"Chen, H.C., Lin, C.H., Chen, A.L.: Music segmentation by rhythmic features and melodic shapes. In: IEEE ICME, pp. 1643\u20131646 (2004)"},{"issue":"4","key":"289_CR14","doi-asserted-by":"crossref","first-page":"1917","DOI":"10.1121\/1.1458024","volume":"111","author":"A. Cheveign\u00e9 de","year":"2002","unstructured":"de Cheveign\u00e9, A., Kawahara, H.: YIN, a fundamental frequency estimator for speech and music. J. Acoust. Soc. Am. 111(4), 1917\u20131930 (2002)","journal-title":"J. Acoust. Soc. Am."},{"key":"289_CR15","unstructured":"Cooper, M., Foote, J.: Automatic music summarization via similarity analysis. In: ISMIR, pp. 81\u201385 (2002)"},{"key":"289_CR16","unstructured":"Dannenberg, R.B., Hu, N.: Pattern discovery techniques for music audio. In: ISMIR, pp. 63\u201370 (2002)"},{"issue":"4","key":"289_CR17","doi-asserted-by":"crossref","first-page":"357","DOI":"10.1109\/TASSP.1980.1163420","volume":"28","author":"S. Davis","year":"1980","unstructured":"Davis, S., Mermelstein, P.: Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences. IEEE Trans. Acoust. Speech Signal Process. 28(4), 357\u2013366 (1980)","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"key":"289_CR18","unstructured":"Dixon, S.: Onset detection revisited. In: International Conference on Digital Audio Effects, pp. 133\u2013137 (2006)"},{"key":"289_CR19","doi-asserted-by":"crossref","unstructured":"Foote, J.: Visualizing music and audio using self-similarity. In: ACM Multimedia, pp. 77\u201380 (1999)","DOI":"10.1145\/319463.319472"},{"key":"289_CR20","doi-asserted-by":"crossref","unstructured":"Foote, J.: Automatic audio segmentation using a measure of audio novelty. In: IEEE ICME, pp. 452\u2013455 (2000)","DOI":"10.1109\/ICME.2000.869637"},{"key":"289_CR21","doi-asserted-by":"crossref","unstructured":"Goto, M.: A chorus-section detecting method for musical audio signals. In: IEEE ICASSP, pp. 437\u2013440 (2003)","DOI":"10.1109\/ASPAA.2003.1285812"},{"issue":"1","key":"289_CR22","first-page":"106","volume":"16","author":"S. Grofit","year":"2008","unstructured":"Grofit, S., Lavner, Y.: Time-scale modification of audio signals using enhanced wsola with management of transients. IEEE Trans. Acoust. Speech Signal Process. 16(1), 106\u2013115 (2008)","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"key":"289_CR23","doi-asserted-by":"crossref","unstructured":"Jojic, N., Petrovic, N., Huang, T.: Scene generative models for adaptive video fast forward. In: IEEE ICIP, vols. 2, 3, pp. II-619\u2013II-22 (2003)","DOI":"10.1109\/ICIP.2003.1246756"},{"key":"289_CR24","doi-asserted-by":"crossref","unstructured":"Kopf, S., Kiess, J., Lemelson, H., Effelsberg, W.: FSCAV: fast seam carving for size adaptation of videos. In: ACM Multimedia, pp. 321\u2013330 (2009)","DOI":"10.1145\/1631272.1631317"},{"issue":"3","key":"289_CR25","doi-asserted-by":"crossref","first-page":"323","DOI":"10.1109\/89.759041","volume":"7","author":"J. Laroche","year":"1999","unstructured":"Laroche, J., Dolson, M.: Improved phase vocoder time-scale modification of audio. IEEE Trans. Acoust. Speech Signal Process. 7(3), 323\u2013332 (1999)","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"key":"289_CR26","unstructured":"Lee, E., Nakra, T.M., Borchers, J.: You\u2019re the conductor: a realistic interactive conducting system for children. In: International Conference on New Interfaces for Musical Expressionaris, pp. 68\u201373 (2004)"},{"key":"289_CR27","doi-asserted-by":"crossref","unstructured":"Levy, M.: A comparison of timbral and harmonic music segmentation algorithms. In: IEEE ICASSP, pp. 1433\u20131436 (2007)","DOI":"10.1109\/ICASSP.2007.367349"},{"key":"289_CR28","unstructured":"Levy, M., Sandler, M., Casey, M.: Extraction of high-level musical structure from audio data and its application to thumbnail generation. In: IEEE ICASSP, pp. 15\u201316 (2006)"},{"key":"289_CR29","doi-asserted-by":"crossref","unstructured":"Liu, Z., Wang, C., Bai, Y., Wang, H., Wang, J.: Musiz: a generic framework for music resizing with stretching and cropping. In: ACM Multimedia, pp. 523\u2013532 (2011)","DOI":"10.1145\/2072298.2072366"},{"key":"289_CR30","doi-asserted-by":"crossref","unstructured":"Liu, Z., Wang, C., Guo, L., Bai, Y., Wang, J.: Lydar: a lyrics density based approach to non-homogeneous music resizing. In: IEEE ICME, pp. 310\u2013315 (2010)","DOI":"10.1109\/ICME.2010.5582603"},{"key":"289_CR31","doi-asserted-by":"crossref","unstructured":"Liu, Z., Wang, C., Wang, J., Zheng, W., Shi, S.: Structure-aware music resizing using lyrics. In: WWW, pp. 1155\u20131156 (2010)","DOI":"10.1145\/1772690.1772851"},{"key":"289_CR32","doi-asserted-by":"crossref","unstructured":"Lu, L., Zhang, H.J.: Automated extraction of music snippets. In: ACM Multimedia, pp. 140\u2013147 (2003)","DOI":"10.1145\/957013.957043"},{"key":"289_CR33","unstructured":"Lu, L., Zhang, H.J., Li, S.Z.: Content-based audio classification and segmentation by using support vector machines. Multimed. Syst. 8(6), 482\u2013492 (2003)"},{"key":"289_CR34","doi-asserted-by":"crossref","unstructured":"Nwe, T.L., Shenoy, A., Wang, Y.: Singing voice detection in popular music. In: ACM Multimedia, pp. 324\u2013327 (2004)","DOI":"10.1145\/1027527.1027602"},{"issue":"1","key":"289_CR35","doi-asserted-by":"crossref","first-page":"155","DOI":"10.1109\/TMM.2004.840604","volume":"7","author":"C. Panagiotakis","year":"2005","unstructured":"Panagiotakis, C., Tziritas, G.: A speech\/music discriminator based on rms and zero-crossings. IEEE Trans. Multimed. 7(1), 155\u2013166 (2005)","journal-title":"IEEE Trans. Multimed."},{"key":"289_CR36","unstructured":"Paulus, J., M\u00fcller, M., Klapuri, A.: Audio-based music structure analysis. In: ISMIR, pp. 625\u2013636 (2010)"},{"key":"289_CR37","doi-asserted-by":"crossref","first-page":"327","DOI":"10.1007\/s11042-005-0895-9","volume":"26","author":"N. Petrovic","year":"2005","unstructured":"Petrovic, N., Jojic, N., Huang, T.S.: Adaptive video fast forward. Multimed. Tools Appl. 26, 327\u2013344 (2005)","journal-title":"Multimed. Tools Appl."},{"key":"289_CR38","doi-asserted-by":"crossref","unstructured":"Plack, C.J., Oxenham, A.J., Fay, R.R., Popper, A.N.: Pitch: neural coding and perception. In: Springer Handbook of Auditory Research, vol. 24. Springer, Berlin (2005)","DOI":"10.1007\/0-387-28958-5"},{"key":"289_CR39","unstructured":"Roebel, A.: Transient detection and preservation in the phase vocoder. In: International Computer Music Conference, pp. 247\u2013250 (2003)"},{"issue":"3","key":"289_CR40","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/1360612.1360615","volume":"27","author":"M. Rubinstein","year":"2008","unstructured":"Rubinstein, M., Shamir, A., Avidan, S.: Improved seam carving for video retargeting. ACM Trans. Graph. 27(3), 1\u20139 (2008)","journal-title":"ACM Trans. Graph."},{"issue":"1","key":"289_CR41","doi-asserted-by":"crossref","first-page":"77","DOI":"10.1145\/1435417.1435437","volume":"52","author":"A. Shamir","year":"2009","unstructured":"Shamir, A., Avidan, S.: Seam carving for media retargeting. Commun. ACM 52(1), 77\u201385 (2009)","journal-title":"Commun. ACM"},{"issue":"12","key":"289_CR42","doi-asserted-by":"crossref","first-page":"2346","DOI":"10.1121\/1.1919362","volume":"36","author":"R.N. Shepard","year":"1964","unstructured":"Shepard, R.N.: Circularity in judgments of relative pitch. J. Acoust. Soc. Am. 36(12), 2346\u20132353 (1964)","journal-title":"J. Acoust. Soc. Am."},{"key":"289_CR43","doi-asserted-by":"crossref","unstructured":"Shi, L., Wang, J., Duan, L., Lu, H.: Consumer video retargeting: context assisted spatial-temporal grid optimization. In: ACM Multimedia, pp. 301\u2013310 (2009)","DOI":"10.1145\/1631272.1631315"},{"issue":"4","key":"289_CR44","first-page":"771","volume":"91","author":"R. Son van","year":"2005","unstructured":"van Son, R.: A study of pitch, formant, and spectral estimation errors introduced by three lossy speech compression algorithms. Acta Acustica United Acustica 91(4), 771\u2013778 (2005)","journal-title":"Acta Acustica United Acustica"},{"key":"289_CR45","doi-asserted-by":"crossref","unstructured":"Tzanetakis, G.: Music analysis, retrieval and synthesis of audio signals marsyas. In: ACM Multimedia, pp. 931\u2013932 (2009)","DOI":"10.1145\/1631272.1631459"},{"issue":"4","key":"289_CR46","doi-asserted-by":"crossref","first-page":"207","DOI":"10.1016\/S0167-6393(99)00051-5","volume":"30","author":"W. Verhelst","year":"2000","unstructured":"Verhelst, W.: Overlap-add methods for time-scaling of speech. Speech Commun. 30(4), 207\u2013221 (2000)","journal-title":"Speech Commun."},{"key":"289_CR47","unstructured":"Weiss, R.J., Bello, J.P.: Identifying repeated patterns in music using sparse convolutive non-negative matrix factorization. In: ISMIR, pp. 123\u2013128 (2010)"},{"key":"289_CR48","doi-asserted-by":"crossref","unstructured":"Wolf, L., Guttmann, M., Cohen-Or, D.: Non-homogeneous content-driven video-retargeting. In: IEEE ICCV, pp. 1\u20136 (2007)","DOI":"10.1109\/ICCV.2007.4409010"},{"key":"289_CR49","doi-asserted-by":"crossref","unstructured":"Xu, C., Zhu, Y., Tian, Q.: Automatic music summarization based on temporal, spectral and cepstral features. In: IEEE ICME, pp. 117\u2013120 (2002)","DOI":"10.1109\/ICME.2002.1035732"},{"key":"289_CR50","doi-asserted-by":"crossref","unstructured":"Zhang, T., Kuo, C.C.J.: Heuristic approach for generic audio data segmentation and annotation. In: ACM Multimedia, pp. 67\u201376 (1999)","DOI":"10.1145\/319463.319471"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-012-0289-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s00530-012-0289-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-012-0289-6","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,5]],"date-time":"2025-04-05T10:04:29Z","timestamp":1743847469000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s00530-012-0289-6"}},"subtitle":["A generic content-aware music resizing framework"],"short-title":[],"issued":{"date-parts":[[2012,7,26]]},"references-count":50,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2013,7]]}},"alternative-id":["289"],"URL":"https:\/\/doi.org\/10.1007\/s00530-012-0289-6","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"type":"print","value":"0942-4962"},{"type":"electronic","value":"1432-1882"}],"subject":[],"published":{"date-parts":[[2012,7,26]]}}}