{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,4]],"date-time":"2026-05-04T10:21:49Z","timestamp":1777890109627,"version":"3.51.4"},"reference-count":47,"publisher":"SAGE Publications","issue":"2","license":[{"start":{"date-parts":[[2016,4,25]],"date-time":"2016-04-25T00:00:00Z","timestamp":1461542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/journals.sagepub.com\/page\/policies\/text-and-data-mining-license"}],"content-domain":{"domain":["journals.sagepub.com"],"crossmark-restriction":true},"short-container-title":["Web Intelligence"],"published-print":{"date-parts":[[2016,4,25]]},"abstract":"<jats:p>To make the search engine more user-friendly, commercial search engines commonly develop applications to provide suggestion or recommendation for every posed query. Clustering semantically similar queries acts as an essential prerequisite to function well in those applications. However, clustering queries effectively is quite challenging, since they are usually short, incomplete and ambiguous. Existing prevalent clustering methods, such as K-Means or DBSCAN cannot guarantee good performance in such a highly dimensional environment. Through analyzing users\u2019 click-through query logs, hierarchical agglomerative clustering gives good results but is computationally quite expensive.<\/jats:p>\n                  <jats:p>This paper identifies a novel feature for clustering search queries based on a key insight \u2013 queries\u2019 top ranked search results can themselves be used to quantify query similarity. After investigating such feature, we propose a new similarity metric for comparing those diverse queries. This facilitates us to develop two very efficient and accurate algorithms integrated in query clustering. We conduct comprehensive experiments to compare the accuracy of our approach against the known baselines along two dimensions: 1) quantifying the cohesion\/separation of clustered queries, and 2) justifying the results by real-world Internet users. The experimental results demonstrate that our two algorithms and the similarity metric can generate more accurate results within a significantly shorter time.<\/jats:p>","DOI":"10.3233\/web-160335","type":"journal-article","created":{"date-parts":[[2016,4,26]],"date-time":"2016-04-26T16:33:55Z","timestamp":1461688435000},"page":"119-138","update-policy":"https:\/\/doi.org\/10.1177\/sage-journals-update-policy","source":"Crossref","is-referenced-by-count":5,"title":["Accurate and efficient query clustering via top ranked search results"],"prefix":"10.1177","volume":"14","author":[{"given":"Yuan","family":"Hong","sequence":"first","affiliation":[{"name":"Department of Information Technology Management, University at Albany, SUNY, USA. E-mail:\u00a0"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jaideep","family":"Vaidya","sequence":"additional","affiliation":[{"name":"Department of Management Science and Information Systems, Rutgers University, USA. E-mail:\u00a0"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haibing","family":"Lu","sequence":"additional","affiliation":[{"name":"Department of Operations and Management Information Systems, Santa Clara University, USA. E-mail:\u00a0"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wen Ming","family":"Liu","sequence":"additional","affiliation":[{"name":"Concordia Institute for Information Systems Engineering, Concordia University, Montreal, Canada. E-mail:\u00a0"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"179","published-online":{"date-parts":[[2016,4,25]]},"reference":[{"key":"ref001","unstructured":"http:\/\/www.worldwidewebsize.com\/."},{"key":"ref002","unstructured":"http:\/\/research.google.com\/university\/search\/."},{"key":"ref003","doi-asserted-by":"crossref","unstructured":"E.\u00a0Agichtein, E.\u00a0Brill and S.T.\u00a0Dumais, Improving web search ranking by incorporating user behavior information, in: Proc. of 29th Annual SIGIR Conference, 2006, pp.\u00a019\u201326.","DOI":"10.1145\/1148170.1148177"},{"key":"ref004","doi-asserted-by":"crossref","unstructured":"E.\u00a0Agichtein, E.\u00a0Brill, S.T.\u00a0Dumais and R.\u00a0Ragno, Learning user interaction models for predicting web search result preferences, in: Proc. of 29th Annual SIGIR Conference, 2006, pp.\u00a03\u201310.","DOI":"10.1145\/1148170.1148175"},{"key":"ref005","doi-asserted-by":"crossref","unstructured":"I.\u00a0Augenstein, A.L.\u00a0Gentile, B.\u00a0Norton, Z.\u00a0Zhang and F.\u00a0Ciravegna, Mapping keywords to linked data resources for automatic query expansion, in: Proc. of the Second International Workshop on Knowledge Discovery and Data Mining Meets Linked Open Data, 2013, pp.\u00a09\u201320.","DOI":"10.1007\/978-3-642-41242-4_9"},{"key":"ref006","doi-asserted-by":"crossref","unstructured":"R.\u00a0Baeza-Yates, C.\u00a0Hurtado and M.\u00a0Mendoza, Query recommendation using query logs in search engines, in: Proc. of 9th International Conference on Extending Database Technology Workshops, 2004, pp.\u00a0588\u2013596.","DOI":"10.1007\/978-3-540-30192-9_58"},{"issue":"12","key":"ref007","first-page":"1793","volume":"58","author":"Baeza-Yates R.A.","year":"2007","journal-title":"Journal of the Association for Information Science and Technology"},{"key":"ref008","doi-asserted-by":"crossref","unstructured":"R.A.\u00a0Baeza-Yates and A.\u00a0Tiberi, Extracting semantic relations from query logs, in: Proc. of 13th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 2007, pp.\u00a076\u201385.","DOI":"10.1145\/1281192.1281204"},{"key":"ref009","unstructured":"M.\u00a0Barbaro and T.\u00a0Zeller\u00a0Jr., A face is exposed for aol searcher no. 4417749, (New York Times), Augest 9, 2006."},{"key":"ref010","doi-asserted-by":"crossref","unstructured":"D.\u00a0Beeferman and A.L.\u00a0Berger, Agglomerative clustering of a search engine query log, in: Proc. of 6th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 2000, pp.\u00a0407\u2013416.","DOI":"10.1145\/347090.347176"},{"key":"ref011","doi-asserted-by":"crossref","unstructured":"G.\u00a0Bordogna, A.\u00a0Campi, G.\u00a0Psaila and S.\u00a0Ronchi, A language for manipulating clustered web documents results, in: Proc. of ACM 17th Conference on Information and Knowledge Management, 2008, pp.\u00a023\u201332.","DOI":"10.1145\/1458082.1458089"},{"key":"ref012","doi-asserted-by":"crossref","unstructured":"H.\u00a0Cao, D.\u00a0Jiang, J.\u00a0Pei, Q.\u00a0He, Z.\u00a0Liao, E.\u00a0Chen and H.\u00a0Li, Context-aware query suggestion by mining click-through and session data, in: Proc. of 14th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, ACM, 2008, pp.\u00a0875\u2013883.","DOI":"10.1145\/1401890.1401995"},{"key":"ref013","unstructured":"Q.\u00a0Chen, M.\u00a0Li and M.\u00a0Zhou, Improving query spelling correction using web search results, in: Proc. of the 2007 Joint Conference on Empirical Methods in Natural Language Processing and Computational Natural Language Learning, ACM, 2007, pp.\u00a0181\u2013189."},{"issue":"3","key":"ref014","first-page":"343","volume":"5","author":"Cheung W.","year":"2007","journal-title":"Web Intelligence and Agent Systems"},{"key":"ref015","unstructured":"S.L.\u00a0Chuang and L.F.\u00a0Chien, Towards automatic generation of query taxonomy: A hierarchical query clustering approach, in: Proc. of the 2002 IEEE International Conference on Data Mining, 2002, pp.\u00a075\u201382."},{"key":"ref016","doi-asserted-by":"crossref","unstructured":"N.\u00a0Craswell and M.\u00a0Szummer, Random walks on the click graph, in: Proc. of 30th Annual SIGIR Conference, ACM, 2007, pp.\u00a0239\u2013246.","DOI":"10.1145\/1277741.1277784"},{"key":"ref017","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2003.1209002"},{"key":"ref018","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.1979.4766909"},{"key":"ref019","unstructured":"T.E.\u00a0Doszkocs and B.A.\u00a0Rapp, Searching MEDLINE in English: A prototype user inter-face with natural language query, ranked output, and relevance feedback, in: Proc. of the ASIS Annual Meeting, 1979, pp.\u00a0131\u2013139."},{"key":"ref020","doi-asserted-by":"crossref","unstructured":"G.\u00a0Dupret and M.\u00a0Mendoza, Automatic query recommendation using click-through data, in: Proc. of IFIP 19th Professional Practice in Artificial Intelligence, 2006, pp.\u00a0303\u2013312.","DOI":"10.1007\/978-0-387-34749-3_32"},{"key":"ref021","unstructured":"M.\u00a0Ester, H.P.\u00a0Kriegel, J.\u00a0Sander and X.\u00a0Xu, A density-based algorithm for discovering clusters in large spatial databases with noise, in: Proc. of 2th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 1996, pp.\u00a0226\u2013231."},{"key":"ref022","doi-asserted-by":"publisher","DOI":"10.1137\/S0895480102412856"},{"key":"ref023","doi-asserted-by":"crossref","unstructured":"B.M.\u00a0Fonseca, P.B.\u00a0Golgher, E.S.\u00a0de\u00a0Moura and N.\u00a0Ziviani, Using association rules to discover search engines related queries, in: Proc. of the First Latin American Web Congress, 2003, pp.\u00a066\u201371.","DOI":"10.1109\/LAWEB.2003.1250284"},{"key":"ref024","doi-asserted-by":"crossref","unstructured":"L.\u00a0Fu, D.H.L.\u00a0Goh, S.S.B.\u00a0Foo and J.C.\u00a0Na, Collaborative querying through a hybrid query clustering approach, in: Proc. of 6th International Conference on Asian Digital Libraries, 2003, pp.\u00a0111\u2013122.","DOI":"10.1007\/978-3-540-24594-0_10"},{"key":"ref025","unstructured":"K.\u00a0Hafner, Researchers yearn to use aol logs, but they hesitate, (New York Times), Augest 23, 2006."},{"key":"ref026","doi-asserted-by":"publisher","DOI":"10.1016\/j.ins.2011.03.007"},{"key":"ref027","doi-asserted-by":"crossref","unstructured":"Y.\u00a0Hong, X.\u00a0He, J.\u00a0Vaidya, N.R.\u00a0Adam and V.\u00a0Atluri, Effective anonymization of query logs, in: Proc. of ACM 18th Conference on Information and Knowledge Management, 2009, pp.\u00a01465\u20131468.","DOI":"10.1145\/1645953.1646146"},{"key":"ref028","doi-asserted-by":"crossref","unstructured":"Y.\u00a0Hong, J.\u00a0Vaidya and H.\u00a0Lu, Search engine query clustering using top-k search results, in: Proc. of the 10th IEEE\/WIC\/ACM International Conference on Web Intelligence, 2011, pp.\u00a0112\u2013119.","DOI":"10.1109\/WI-IAT.2011.224"},{"key":"ref029","doi-asserted-by":"publisher","DOI":"10.1109\/TDSC.2014.2369034"},{"key":"ref030","doi-asserted-by":"crossref","unstructured":"Y.\u00a0Hong, J.\u00a0Vaidya, H.\u00a0Lu and M.\u00a0Wu, Differentially private search log sanitization with optimal output utility, in: Proc. of 15th International Conference on Extending Database Technology, 2012, pp.\u00a050\u201361.","DOI":"10.1145\/2247596.2247604"},{"key":"ref031","doi-asserted-by":"publisher","DOI":"10.1016\/j.ipm.2012.08.002"},{"key":"ref032","doi-asserted-by":"crossref","unstructured":"U.\u00a0Irmak, V.\u00a0von Brzeski and R.\u00a0Kraft, Contextual ranking of keywords using click data, in: Proc. of the 25th International Conference on Data Engineering, 2009, pp.\u00a0457\u2013468.","DOI":"10.1109\/ICDE.2009.76"},{"key":"ref033","doi-asserted-by":"crossref","unstructured":"T.\u00a0Joachims, Optimizing search engines using clickthrough data, in: Proc. of 8th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, ACM, 2002, pp.\u00a0133\u2013142.","DOI":"10.1145\/775047.775067"},{"key":"ref034","doi-asserted-by":"publisher","DOI":"10.1109\/TKDE.2008.84"},{"key":"ref035","doi-asserted-by":"crossref","unstructured":"B.\u00a0Mobasher, Data mining for web personalization, in: The Adaptive Web, 2007, pp.\u00a090\u2013135.","DOI":"10.1007\/978-3-540-72079-9_3"},{"key":"ref036","unstructured":"C.H.\u00a0Papadimitriou and K.\u00a0Steiglitz, Combinatorial Optimization: Algorithms and Complexity, Prentice-Hall, Inc., Upper Saddle River, NJ, USA, 1982."},{"key":"ref037","doi-asserted-by":"crossref","unstructured":"F.\u00a0Radlinski and T.\u00a0Joachims, Query chains: Learning to rank from implicit feedback, in: Proc. of 11th ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, 2005, pp.\u00a0239\u2013248.","DOI":"10.1145\/1081870.1081899"},{"key":"ref038","doi-asserted-by":"crossref","unstructured":"S.\u00a0Saitta, B.\u00a0Raphael and I.F.C.\u00a0Smith, A bounded index for cluster validity, in: Proc. of the 5th International Conference on Machine Learning and Data Mining in Pattern Recognition, 2007, pp.\u00a0174\u2013187.","DOI":"10.1007\/978-3-540-73499-4_14"},{"key":"ref039","doi-asserted-by":"crossref","unstructured":"X.\u00a0Shi and C.C.\u00a0Yang, Mining related queries from search engine query logs, in: Proc. of the 15th International World Wide Web Conference, 2006, pp.\u00a0943\u2013944.","DOI":"10.1145\/1135777.1135956"},{"key":"ref040","doi-asserted-by":"crossref","unstructured":"F.\u00a0Silvestri, Mining query logs: Turning search usage data into knowledge,\n                      Foundations and Trends in Information Retrieval\n                      (2010).","DOI":"10.1561\/9781601982834"},{"key":"ref041","unstructured":"P.\u00a0Tan, M.\u00a0Steinbach and V.\u00a0Kumar, Introduction to Data Mining, Addison-Wesley Longman Publishing Co., Inc., Boston, MA, USA, 2005."},{"issue":"4","key":"ref042","first-page":"431","volume":"4","author":"Wakaki T.","year":"2006","journal-title":"Web Intelligence and Agent Systems"},{"key":"ref043","doi-asserted-by":"crossref","unstructured":"S.\u00a0Walter, C.\u00a0Unger, P.\u00a0Cimiano and D.\u00a0Bar, Evaluation of a layered approach to question answering over linked data, in: Proc. of the 11th International Conference on the Semantic Web \u2013 Volume Part II, 2012, pp.\u00a0362\u2013374.","DOI":"10.1007\/978-3-642-35173-0_25"},{"key":"ref044","doi-asserted-by":"crossref","unstructured":"J.R.\u00a0Wen, J.Y.\u00a0Nie and H.J.\u00a0Zhang, Clustering user queries of a search engine, in: Proc. of the 10th International World Wide Web Conference, 2001, pp.\u00a0162\u2013168.","DOI":"10.1145\/371920.371974"},{"key":"ref045","doi-asserted-by":"publisher","DOI":"10.1145\/503104.503108"},{"key":"ref046","doi-asserted-by":"crossref","unstructured":"J.\u00a0Yi and F.\u00a0Maghoul, Query clustering using click-through graph, in: Proc. of the 18th International World Wide Web Conference, 2009, pp.\u00a01055\u20131056.","DOI":"10.1145\/1526709.1526853"},{"key":"ref047","doi-asserted-by":"crossref","unstructured":"E.\u00a0Yilmaz, J.A.\u00a0Aslam and S.\u00a0Robertson, A new rank correlation coefficient for information retrieval, in: Proc. of 31th Annual SIGIR Conference, 2008, pp.\u00a0587\u2013594.","DOI":"10.1145\/1390334.1390435"}],"container-title":["Web Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/journals.sagepub.com\/doi\/pdf\/10.3233\/WEB-160335","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/journals.sagepub.com\/doi\/full-xml\/10.3233\/WEB-160335","content-type":"application\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/journals.sagepub.com\/doi\/pdf\/10.3233\/WEB-160335","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T05:26:55Z","timestamp":1777613215000},"score":1,"resource":{"primary":{"URL":"https:\/\/journals.sagepub.com\/doi\/full\/10.3233\/WEB-160335"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,4,25]]},"references-count":47,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2016,4,25]]}},"alternative-id":["10.3233\/WEB-160335"],"URL":"https:\/\/doi.org\/10.3233\/web-160335","relation":{},"ISSN":["2405-6456","2405-6464"],"issn-type":[{"value":"2405-6456","type":"print"},{"value":"2405-6464","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016,4,25]]}}}