{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,12]],"date-time":"2026-05-12T08:56:14Z","timestamp":1778576174963,"version":"3.51.4"},"reference-count":47,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2015,8,12]],"date-time":"2015-08-12T00:00:00Z","timestamp":1439337600000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["World Wide Web"],"published-print":{"date-parts":[[2016,9]]},"DOI":"10.1007\/s11280-015-0365-x","type":"journal-article","created":{"date-parts":[[2015,8,11]],"date-time":"2015-08-11T02:31:16Z","timestamp":1439260276000},"page":"887-920","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":12,"title":["Graph vs. bag representation models for the topic classification of web documents"],"prefix":"10.1007","volume":"19","author":[{"given":"George","family":"Papadakis","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"George","family":"Giannakopoulos","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Georgios","family":"Paliouras","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2015,8,12]]},"reference":[{"key":"365_CR1","unstructured":"Amini, M.R., Usunier, N., Goutte, C.: Learning from multiple partially observed views - an application to multilingual text categorization. In: NIPS, pp. 28\u201336 (2009)"},{"key":"365_CR2","unstructured":"Batista, F., Ribeiro, R.: Sentiment analysis and topic classification based on binary maximum entropy classifiers. Proc. Leng. Nat. 50, 77\u201384 (2013)"},{"key":"365_CR3","doi-asserted-by":"crossref","unstructured":"Berry, M.W., Kogan, J.: Text Mining: Applications and Theory. Wiley, Chichester (2010)","DOI":"10.1002\/9780470689646"},{"key":"365_CR4","unstructured":"Blei, D., Ng, A., Jordan, M.: Latent dirichlet allocation. J. Mach. Learn. Res. 3, 993\u20131022 (2003)"},{"key":"365_CR5","unstructured":"Choudhary, B., Bhattacharyya, P.: Text clustering using semantics. World Wide Web Conference (2002)"},{"key":"365_CR6","unstructured":"Choudhary, B., Bhattacharyya, P.: Text clustering using universal networking language representation. World Wide Web Conference (2002)"},{"key":"365_CR7","doi-asserted-by":"crossref","unstructured":"Dasgupta, A., Drineas, P., Harb, B., Josifovski, V., Mahoney, M.W.: Feature selection methods for text classification. In: KDD, pp 230\u2013239 (2007)","DOI":"10.1145\/1281192.1281220"},{"issue":"6","key":"365_CR8","doi-asserted-by":"crossref","first-page":"391","DOI":"10.1002\/(SICI)1097-4571(199009)41:6<391::AID-ASI1>3.0.CO;2-9","volume":"41","author":"S Deerwester","year":"1990","unstructured":"Deerwester, S., Dumais, S., Furnas, G., Landauer, T., Harshman, R.: Indexing by latent semantic analysis. J. Am. Soc. Inf. Sci. 41(6), 391\u2013407 (1990)","journal-title":"J. Am. Soc. Inf. Sci."},{"issue":"3","key":"365_CR9","doi-asserted-by":"crossref","first-page":"755","DOI":"10.1162\/COLI_a_00149","volume":"39","author":"E D\u2019hondt","year":"2013","unstructured":"D\u2019hondt, E., Verberne, S., Koster, C.H.A., Boves, L.: Text representations for patent classification. Comput. Linguist. 39(3), 755\u2013775 (2013)","journal-title":"Comput. Linguist."},{"key":"365_CR10","doi-asserted-by":"crossref","unstructured":"Dumais, S., Chen, H.: Hierarchical classification of web content. In: SIGIR, pp. 256\u2013263 (2000)","DOI":"10.1145\/345508.345593"},{"key":"365_CR11","unstructured":"Eisenstein, J., O\u2019Connor, B., Smith, N.A., Xing, E.P.: A latent variable model for geographic lexical variation. In: EMNLP, pp. 1277\u20131287 (2010)"},{"key":"365_CR12","first-page":"1871","volume":"9","author":"R Fan","year":"2008","unstructured":"Fan, R., Chang, K., Hsieh, C., Wang, X., Lin, C.: Liblinear: A library for large linear classification. J. Mach. Learn. Res. 9, 1871\u20131874 (2008)","journal-title":"J. Mach. Learn. Res."},{"key":"365_CR13","doi-asserted-by":"crossref","unstructured":"Figueiredo, F., Bel\u00e9m, F., Pinto, H., Almeida, J.M., Gon\u00e7alves, M.A., Fernandes, D., de Moura, E.S., Cristo, M.: Evidence of quality of textual features on the web 2.0. In: CIKM, pp 909\u2013918 (2009)","DOI":"10.1145\/1645953.1646070"},{"key":"365_CR14","first-page":"1289","volume":"3","author":"G Forman","year":"2003","unstructured":"Forman, G.: An extensive empirical study of feature selection metrics for text classification. J. Mach. Learn. Res. 3, 1289\u20131305 (2003)","journal-title":"J. Mach. Learn. Res."},{"key":"365_CR15","unstructured":"Garcia Esparza, S., O\u2019Mahony, M., Smyth, B.: Towards tagging and categorization for micro-blogs. In: AICS (2010)"},{"key":"365_CR16","doi-asserted-by":"crossref","unstructured":"Genc, Y., Sakamoto, Y., Nickerson, J.V.: Discovering Context: Classifying Tweets through a Semantic Transform Based on Wikipedia, pp 484\u2013492 (2011)","DOI":"10.1007\/978-3-642-21852-1_55"},{"key":"365_CR17","doi-asserted-by":"crossref","unstructured":"Giannakopoulos, G., Karkaletsis, V., Vouros, G.A., Stamatopoulos, P.: Summarization system evaluation revisited: N-gram graphs. TSLP 5(3) (2008)","DOI":"10.1145\/1410358.1410359"},{"key":"365_CR18","doi-asserted-by":"crossref","unstructured":"Giannakopoulos, G., Palpanas, T.: Content and type as orthogonal modeling features: a study on user interest awareness in entity subscription services. Int. J. Adv. Netw. Serv. 3(2) (2010)","DOI":"10.1109\/ComputationWorld.2009.75"},{"issue":"1","key":"365_CR19","doi-asserted-by":"crossref","first-page":"10","DOI":"10.1145\/1656274.1656278","volume":"11","author":"M Hall","year":"2009","unstructured":"Hall, M., Frank, E., Holmes, G., Pfahringer, B., Reutemann, P., Witten, I.: The WEKA data mining software: An update. ACM SIGKDD Explor. Newsl. 11(1), 10\u201318 (2009)","journal-title":"ACM SIGKDD Explor. Newsl."},{"key":"365_CR20","doi-asserted-by":"crossref","unstructured":"Hong, L., Davison, B.: Empirical study of topic modeling in twitter. In: SOMA, pp. 80\u201388 (2010)","DOI":"10.1145\/1964858.1964870"},{"key":"365_CR21","unstructured":"Irani, D., Webb, S., Pu, C., Li, K.: Study of trend-stuffing on twitter through text classification. In: CEAS, pp. 40\u201349 (2010)"},{"key":"365_CR22","doi-asserted-by":"crossref","unstructured":"Joachims, T.: Text categorization with suport vector machines: Learning with many relevant features. In: ECML, pp. 137\u2013142 (1998)","DOI":"10.1007\/BFb0026683"},{"key":"365_CR23","unstructured":"Keselj, V., Peng, F., Cercone, N., Thomas, C.: N-gram-based author profiles for authorship attribution. In: PACLING, pp. 255\u2013264 (2003)"},{"key":"365_CR24","first-page":"269","volume":"31","author":"A Khorsi","year":"2007","unstructured":"Khorsi, A.: An overview of content-based spam filtering techniques. Informatica 31, 269\u2013277 (2007)","journal-title":"Informatica"},{"key":"365_CR25","doi-asserted-by":"crossref","unstructured":"Kinsella, S., Passant, A., Breslin, J.G.: Topic classification in social media using metadata from hyperlinked objects. In: ECIR, pp 201\u2013206 (2011)","DOI":"10.1007\/978-3-642-20161-5_20"},{"key":"365_CR26","doi-asserted-by":"crossref","unstructured":"Kinsella, S., Wang, M., Breslin, J.G., Hayes, C.: Improving categorisation in social media using hyperlinks to structured data sources. In: ESWC (2), pp 390\u2013404 (2011)","DOI":"10.1007\/978-3-642-21064-8_27"},{"key":"365_CR27","doi-asserted-by":"crossref","unstructured":"Li, Z., Zhou, D., Juan, Y.F., Han, J.: Keyword extraction for social snippets. In: WWW, pp. 1143\u20131144 (2010)","DOI":"10.1145\/1772690.1772845"},{"key":"365_CR28","first-page":"419","volume":"2","author":"H Lodhi","year":"2002","unstructured":"Lodhi, H., Saunders, C., Shawe-Taylor, J., Cristianini, N., Watkins, C.: Text classification using string kernels. J. Mach. Learn. Res. 2, 419\u2013444 (2002)","journal-title":"J. Mach. Learn. Res."},{"key":"365_CR29","doi-asserted-by":"crossref","unstructured":"Manning, C., Raghavan, P., Schuetze, H.: Introduction to information retrieval, vol. 1. Cambridge University Press (2008)","DOI":"10.1017\/CBO9780511809071"},{"key":"365_CR30","doi-asserted-by":"crossref","unstructured":"Meng, W., Lanfen, L., Jing, W., Penghua, Y., Jiaolong, L., Fei, X.: Improving short text classification using public search engines. In: Integrated Uncertainty in Knowledge Modelling and Decision Making, pp 157\u2013166 (2013)","DOI":"10.1007\/978-3-642-39515-4_14"},{"key":"365_CR31","unstructured":"Pak, A., Paroubek, P.: Twitter as a corpus for sentiment analysis and opinion mining, pp. 1320\u20131326. LREC (2010)"},{"key":"365_CR32","doi-asserted-by":"crossref","unstructured":"Peng, F., Schuurmans, D.: Combining naive bayes and n-gram language models for text classification. Advances in Information Retrieval, pp. 547\u2013547 (2003)","DOI":"10.1007\/3-540-36618-0_24"},{"key":"365_CR33","doi-asserted-by":"crossref","unstructured":"Phan, X.H., Nguyen, M.L., Horiguchi, S.: Learning to classify short and sparse text & web with hidden topics from large-scale data collections. In: WWW, pp. 91\u2013100 (2008)","DOI":"10.1145\/1367497.1367510"},{"key":"365_CR34","doi-asserted-by":"crossref","unstructured":"Rosa, H., Batista, F., Carvalho, J.P.: Twitter topic fuzzy fingerprints. In: IEEE International Conference on Fuzzy Systems, pp 776\u2013783 (2014)","DOI":"10.1109\/FUZZ-IEEE.2014.6891781"},{"key":"365_CR35","unstructured":"Salton, G.: The Smart Retrieval System \u2013 Experiments in Automatic Document Processing, p. 556. Prentice-Hall (1971)"},{"issue":"1","key":"365_CR36","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/505282.505283","volume":"34","author":"F Sebastiani","year":"2002","unstructured":"Sebastiani, F.: Machine learning in automated text categorization. ACM Comput. Surv. 34(1), 1\u201347 (2002)","journal-title":"ACM Comput. Surv."},{"key":"365_CR37","doi-asserted-by":"crossref","unstructured":"Sebastiani, F.: Text categorization. In: Encyclopedia of Database Technologies and Applications, pp. 683\u2013687 (2005)","DOI":"10.4018\/978-1-59140-560-3.ch112"},{"key":"365_CR38","doi-asserted-by":"crossref","unstructured":"Sriram, B., Fuhry, D., Demir, E., Ferhatosmanoglu, H., Demirbas, M.: Short text classification in twitter to improve information filtering. In: SIGIR, pp. 841\u2013842 (2010)","DOI":"10.1145\/1835449.1835643"},{"key":"365_CR39","unstructured":"Stamatatos, E.: Ensemble-based author identification using character n-grams. In: Proceedings of the 3rd International Workshop on Text-based Information Retrieval, pp. 41\u201346 (2006)"},{"issue":"3","key":"365_CR40","doi-asserted-by":"crossref","first-page":"538","DOI":"10.1002\/asi.21001","volume":"60","author":"E Stamatatos","year":"2009","unstructured":"Stamatatos, E.: A survey of modern authorship attribution methods. J. Am. Soc. Inf. Sci. Technol. 60(3), 538\u2013556 (2009)","journal-title":"J. Am. Soc. Inf. Sci. Technol."},{"issue":"2","key":"365_CR41","first-page":"421","volume":"21","author":"E Stamatatos","year":"2013","unstructured":"Stamatatos, E.: On the robustness of authorship attribution based on character n-gram features. J. Law Policy 21(2), 421\u2013439 (2013)","journal-title":"J. Law Policy"},{"issue":"4","key":"365_CR42","doi-asserted-by":"crossref","first-page":"471","DOI":"10.1162\/089120100750105920","volume":"26","author":"E Stamatatos","year":"2000","unstructured":"Stamatatos, E., Fakotakis, N., Kokkinakis, G.: Automatic text categorization in terms of genre and author. Comput. Linguist. 26(4), 471\u2013495 (2000)","journal-title":"Comput. Linguist."},{"key":"365_CR43","doi-asserted-by":"crossref","unstructured":"Sun, X., Wang, H., Yu, Y.: Towards effective short text deep classification. In: SIGIR, pp. 1143\u20131144 (2011)","DOI":"10.1145\/2009916.2010090"},{"key":"365_CR44","unstructured":"Witten, I., Frank, E.: Data Mining: Practical Machine Learning Tools and Techniques, p. 560. Morgan Kaufmann, San Francisco (2005)"},{"key":"365_CR45","doi-asserted-by":"crossref","unstructured":"Yang, J., Leskovec, J.: Patterns of temporal variation in online media. In: WSDM, pp. 177\u2013186 (2011)","DOI":"10.1145\/1935826.1935863"},{"key":"365_CR46","doi-asserted-by":"crossref","unstructured":"Yang, S., Kolcz, A., Schlaikjer, A., Gupta, P.: Large-scale high-precision topic modeling on twitter. In: KDD, pp. 1907\u20131916 (2014)","DOI":"10.1145\/2623330.2623336"},{"key":"365_CR47","unstructured":"Zelikovitz, S., Hirsh, H.: Transductive lsi for short text classification problems. In: FLAIRS, pp. 556\u2013561 (2004)"}],"container-title":["World Wide Web"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11280-015-0365-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11280-015-0365-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11280-015-0365-x","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,20]],"date-time":"2022-05-20T04:55:50Z","timestamp":1653022550000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11280-015-0365-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,8,12]]},"references-count":47,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2016,9]]}},"alternative-id":["365"],"URL":"https:\/\/doi.org\/10.1007\/s11280-015-0365-x","relation":{},"ISSN":["1386-145X","1573-1413"],"issn-type":[{"value":"1386-145X","type":"print"},{"value":"1573-1413","type":"electronic"}],"subject":[],"published":{"date-parts":[[2015,8,12]]}}}