{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,26]],"date-time":"2025-03-26T20:14:18Z","timestamp":1743020058774,"version":"3.40.3"},"publisher-location":"Cham","reference-count":59,"publisher":"Springer International Publishing","isbn-type":[{"type":"print","value":"9783319990033"},{"type":"electronic","value":"9783319990040"}],"license":[{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019]]},"DOI":"10.1007\/978-3-319-99004-0_2","type":"book-chapter","created":{"date-parts":[[2019,2,6]],"date-time":"2019-02-06T12:11:22Z","timestamp":1549455082000},"page":"13-53","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Cross-Language Comparability and Its Applications for MT"],"prefix":"10.1007","author":[{"given":"Bogdan","family":"Babych","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fangzhong","family":"Su","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Anthony","family":"Hartley","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ahmet","family":"Aker","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Monica Lestari","family":"Paramita","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Paul","family":"Clough","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Robert","family":"Gaizauskas","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2019,2,7]]},"reference":[{"key":"2_CR1","unstructured":"Adafre, S. F., & de Rijke, M. (2006). Finding similar sentences across multiple languages in Wikipedia. Proceedings of the EACL Workshop on New Text, Trento, Italy."},{"key":"2_CR2","unstructured":"Babych, B., Hartley, A., Sharoff, S., & Mudraya, O. (2007). Assisting translators in indirect lexical transfer. Proceedings of the 45th Annual Meeting of the Association of Computational Linguistics (pp. 136\u2013143)."},{"key":"2_CR3","unstructured":"Babych, B., Sharoff S., & Hartley, A. (2008). Generalising lexical translation strategies for MT using comparable corpora. Proceedings of LREC 2008, Marrakech, Morocco."},{"key":"2_CR4","doi-asserted-by":"crossref","unstructured":"Bharadwaj, R. G., & Varma, V. (2011). Language independent identification of parallel sentences using Wikipedia. Proceedings of the 20th International Conference Companion on World Wide Web, WWW \u201911 (pp. 11\u201312).","DOI":"10.1145\/1963192.1963199"},{"key":"2_CR5","doi-asserted-by":"crossref","unstructured":"Chiao, Y.-Ch., & Zweigenbaum, P. (2002). Looking for candidate translational equivalents in specialized, comparable corpora. Proceedings of COLING 2002, Taipei, Taiwan.","DOI":"10.3115\/1071884.1071904"},{"key":"2_CR6","doi-asserted-by":"crossref","unstructured":"Daille, B., & Morin, E. (2005). French-English terminology extraction from comparable corpora. IJCNLP (pp. 707\u2013718).","DOI":"10.1007\/11562214_62"},{"key":"2_CR7","unstructured":"Eisele, A., & Xu, J. (2010). improving machine translation performance using comparable corpora. Proceedings of the LREC Workshop on Building and Using Comparable Corpora, Malta, May 2010."},{"key":"2_CR8","doi-asserted-by":"crossref","unstructured":"Eisele, A., Federmann, C., Saint-Amand, H., Jellinghaus, M., Herrmann, T., & Chen, Y. (2008). Using Moses to integrate multiple rule-based machine translation engines into a hybrid system. Proceedings of the Third Workshop on Statistical Machine Translation (pp. 179\u2013182).","DOI":"10.3115\/1626394.1626422"},{"key":"2_CR9","doi-asserted-by":"publisher","first-page":"67","DOI":"10.2197\/ipsjjip.16.68","volume":"16","author":"M Erdmann","year":"2008","unstructured":"Erdmann, M., Nakayama, K., Hara, T., & Nishio, S. (2008). Extraction of bilingual terminology from a multilingual web-based encyclopedia. Journal of Information Processing, 16, 67\u201379.","journal-title":"Journal of Information Processing"},{"key":"2_CR10","doi-asserted-by":"publisher","DOI":"10.7551\/mitpress\/7287.001.0001","volume-title":"WordNet: An electronic lexical database","author":"C Fellbaum","year":"1998","unstructured":"Fellbaum, C. (1998). WordNet: An electronic lexical database. Cambridge, MA: MIT Press."},{"key":"2_CR11","unstructured":"Filatova, E. (2009). Directions for exploiting asymmetries in multilingual Wikipedia. Proceedings of the Third International Workshop on Cross Lingual Information Access: Addressing the Information Need of Multilingual Societies (CLIAWS3 '09)."},{"key":"2_CR12","doi-asserted-by":"crossref","unstructured":"Finkel, J., Grenager, T., & Manning, C. (2005). Incorporating non-local information into information extraction systems by gibbs sampling. Proceedings of ACL 2005, University of Michigan, Ann Arbor, MI.","DOI":"10.3115\/1219840.1219885"},{"key":"2_CR13","unstructured":"Frank, E., Paynter, G, & Witten, I. (1999). Domain-specific keyphrase extraction. Proceedings of IJCAI 1999, Stockholm, Sweden."},{"key":"2_CR14","doi-asserted-by":"crossref","unstructured":"Fung, P. (1998). A statistical view on bilingual lexicon extraction: From parallel corpora to non-parallel corpora. Proceedings of the 3rd Conference of the Association for Machine Translation in the Americas (AMTA\u201998) (pp. 1\u201316). Springer.","DOI":"10.1007\/3-540-49478-2_1"},{"key":"2_CR15","unstructured":"Fung, P., & Cheung, P. (2004a). Mining very non-parallel corpora: Parallel sentence and lexicon extraction via bootstrapping and EM. Proceedings of EMNLP 2004, Barcelona, Spain."},{"key":"2_CR16","doi-asserted-by":"crossref","unstructured":"Fung, P., & Cheung, P. (2004b). Multi-level bootstrapping for extracting parallel sentences from a quasicomparable corpus. Proceedings of COL- ING 2004, Geneva, Switzerland.","DOI":"10.3115\/1220355.1220506"},{"key":"2_CR17","unstructured":"Fung, P., & Yee, L. Y. (1998). An IR approach for translating new words from nonparallel, comparable texts. COLING \u201998: Proceedings of the 17th International Conference on Computational Linguistics (pp. 414\u2013420)."},{"key":"2_CR59","unstructured":"Gamallo, P. O., & L\u00f3pez, I. G. (2010). Wikipedia as multilingual source of comparable corpora. Proceedings of the 3rd Workshop on Building and Using Comparable Corpora, LREC (pp. 21\u201325). \n                  http:\/\/www.fb06.unimainz.de\/lk\/bucc2010\/documents\/Proceedings-BUCC-2010.pdf#page=29"},{"key":"2_CR18","unstructured":"Hatzivassiloglou, V., Klavans, J. L., & Eskin, E. (1999). Detecting text similarity over short passages: Exploring linguistic feature combinations via machine learning. Proceedings of the 1999 Joint SIGDAT Conference on Empirical Methods in Natural Language Processing and Very Large Corpora (pp. 203\u2013212)."},{"key":"2_CR19","doi-asserted-by":"crossref","unstructured":"Hulth, A. (2003). Improved automatic keyword extraction given more linguistic knowledge. Proceedings of EMNLP 2003, Sapporo, Japan.","DOI":"10.3115\/1119355.1119383"},{"key":"2_CR20","unstructured":"Ion, R. (2012). PEXACC: A parallel data mining algorithm from comparable corpora. Proceedings of LREC 2012, Istanbul, Turkey."},{"key":"2_CR21","doi-asserted-by":"publisher","first-page":"499","DOI":"10.1016\/j.ipm.2009.05.003","volume":"45","author":"I Kanaris","year":"2009","unstructured":"Kanaris, I., & Stamatatos, E. (2009). Learning to recognize webpage genres. Information Processing and Management, 45, 499\u2013512.","journal-title":"Information Processing and Management"},{"key":"2_CR22","unstructured":"Kessler, B., Numberg, G., & Schuetze, H. (1998). Automatic detection of text genre. ACL '98: Proceedings of the 35th Annual Meeting of the Association for Computational Linguistics and Eighth Conference of the European Chapter of the Association for Computational Linguistics (pp. 32\u201338)."},{"issue":"1","key":"2_CR23","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1075\/ijcl.6.1.05kil","volume":"6","author":"A Kilgarriff","year":"2001","unstructured":"Kilgarriff, A. (2001). Comparing corpora. International Journal of Corpus Linguistics, 6(1), 1\u201337 (Reprinted in Teubert & Krishnamurthy (Eds.), Corpus linguistics: Critical concepts in linguistics. Routledge. 2007.) Retrieved from \n                  http:\/\/www.kilgarriff.co.uk\/Publications\/2001-K-CompCorpIJCL.pdf\n                  \n                .","journal-title":"International Journal of Corpus Linguistics"},{"key":"2_CR24","unstructured":"Kilgarriff, A., & Rose, T. (1998). Measures for corpus similarity and homogeneity. Proceedings of EMNLP 1998, Granada, Spain."},{"key":"2_CR25","unstructured":"Lee, M. D., Pincombe, B., & Welsh, M. (2005). An empirical evaluation of models of text document similarity. Proceedings of the 27th Annual Conference of the Cognitive Science Society (pp. 1254\u20131259)."},{"key":"2_CR26","unstructured":"Li, B., & Gaussier, E. (2010). Improving corpus comparability for bilingual lexicon extraction from comparable corpora. Proceedings of COLING 2010, Beijing, China."},{"issue":"8","key":"2_CR27","doi-asserted-by":"publisher","first-page":"1138","DOI":"10.1109\/TKDE.2006.130","volume":"18","author":"Y Li","year":"2006","unstructured":"Li, Y., McLean, D., Bandar, Z., O\u2019Shea, J., & Crockett, K. (2006). Sentence similarity based on semantic nets and corpus statistics. IEEE Transactions on Knowledge and Data Engineering, 18(8), 1138\u20131150.","journal-title":"IEEE Transactions on Knowledge and Data Engineering"},{"key":"2_CR28","unstructured":"Lin, W., Snover, M., & Ji, H. (2011). Unsupervised language-independent name translation mining from Wikipedia infoboxes. Proceedings of EMNLP 2011, Conference on Empirical Methods in Natural Language Processing (pp. 43\u201352). Edinburgh, Scotland (pp. 27\u201331)."},{"key":"2_CR29","doi-asserted-by":"crossref","unstructured":"Liu, F., Pennell, D., Liu, F., & Liu, Y. (2009). Unsupervised approaches for automatic keyword extraction using meeting transcripts. Proceedings of NAACL 2009, Boulder, Colorado.","DOI":"10.3115\/1620754.1620845"},{"key":"2_CR30","unstructured":"Lu, Y., Huang, J., & Liu, Q. (2007). Improving statistical machine translation performance by training data selection and optimization. Proceedings of the 2007 EMNLP-CoNLL (pp. 343\u2013350)."},{"key":"2_CR31","unstructured":"Maia, B. (2003). What are comparable corpora? Proceedings of the Corpus Linguistics Workshop on Multilingual Corpora: Linguistic Requirements and Technical Perspectives, Lancaster."},{"key":"2_CR32","unstructured":"McEnery, A., & Xiao, Z. (2007). Parallel and comparable corpora? Incorporating Corpora: Translation and the Linguist. Translating Europe. Multilingual Matters, Clevedon."},{"key":"2_CR33","unstructured":"Morin, E., Daille, B., Takeuchi, K., & Kageura, K. (2007). Bilingual terminology mining \u2013 using brain, not brawn comparable corpora. Proceedings of ACL 2007 (pp. 664\u2013671), Prague, Czech Republic."},{"issue":"4","key":"2_CR34","doi-asserted-by":"publisher","first-page":"477","DOI":"10.1162\/089120105775299168","volume":"31","author":"D Munteanu","year":"2005","unstructured":"Munteanu, D., & Marcu, D. (2005). Improving machine translation performance by exploiting non-parallel corpora. Computational Linguistics, 31(4), 477\u2013504.","journal-title":"Computational Linguistics"},{"key":"2_CR35","unstructured":"Munteanu, D. S., & Marcu, D. (2006). Extracting parallel sub-sentential fragments from non-parallel corpora. ACL-2006: Proceedings of the 21st International Conference on Computational Linguistics and the 44th Annual Meeting of the Association for Computational Linguistics (pp. 81\u201388), Sydney, Australia."},{"key":"2_CR36","unstructured":"Munteanu, D. S., Fraser, A., Marcu, D. (2004). Improved machine translation performance via parallel sentence extraction from comparable corpora. In: HLT-NAACL 2004: Main Proceedings (pp. 265\u2013272)."},{"key":"2_CR37","doi-asserted-by":"crossref","unstructured":"Och, F., & Ney, H. (2000). Improved statistical alignment models. Proceedings of ACL 2000, Hongkong, China.","DOI":"10.3115\/1075218.1075274"},{"issue":"1","key":"2_CR38","doi-asserted-by":"publisher","first-page":"19","DOI":"10.1162\/089120103321337421","volume":"29","author":"F Och","year":"2003","unstructured":"Och, F., & Ney, H. (2003). A systematic comparison of various statistical alignment models. Computational Linguistics, 29(1), 19\u201351.","journal-title":"Computational Linguistics"},{"key":"2_CR39","unstructured":"Otero, P. G., & L\u00f3pez, I. G. (2010). Wikipedia as multilingual source of comparable corpora. Proceedings of the LREC Workshop on BUCC (pp. 30\u201337)."},{"key":"2_CR40","unstructured":"Patry, A., & Langlais, P. (2011). Identifying parallel documents from a large bilingual collection of texts: Application to parallel article extraction in Wikipedia. Proceedings of the 4th Workshop on Building and Using Comparable Corpora (pp. 87\u201395)."},{"key":"2_CR41","unstructured":"Prochasson, E., & Fung, P. (2011). Rare word translation extraction from aligned comparable documents. Proceedings of ACL-HLT 2011, Portland, OR."},{"key":"2_CR42","unstructured":"Rapp, R. (1995). Identifying word translations in non-parallel texts. ACL \u201895: Proceedings of the 33rd Annual Meeting on Association for Computational Linguistics (pp. 320\u2013322), Cambridge, MA."},{"key":"2_CR43","unstructured":"Rapp, R. (1999). Automatic identification of word translations from unrelated English and German corpora. ACL \u201999: Proceedings of the 37th Annual Meeting of the Association for Computational Linguistics on Computational Linguistics (pp. 519\u2013526). College Park, MA."},{"key":"2_CR44","unstructured":"Rayson, P., & Garside, R. (2000). Comparing corpora using frequency profiling. WCC \u201800: Proceedings of the Workshop on Comparing Corpora (pp. 1\u20136)."},{"key":"2_CR45","unstructured":"Saralegi, X., Vicente, I., & Gurrutxaga, A. (2008). Automatic extraction of bilingual terms from comparable corpora in a popular science domain. Proceedings of the Workshop on Comparable Corpora, LREC 2008, Marrakech, Morocco."},{"key":"2_CR46","unstructured":"Sharoff, S. (2007). Classifying Web corpora into domain and genre using automatic feature identification. Proceedings of 3rd Web as Corpus Workshop, Louvain-la-Neuve, Belgium."},{"key":"2_CR47","doi-asserted-by":"crossref","unstructured":"Sharoff, S., Babych, B., & Hartley, A. (2006). Using comparable corpora to solve problems difficult for human translators. COLING\/ACL 2006 Main Conference Poster Sessions (pp. 739\u2013746).","DOI":"10.3115\/1273073.1273168"},{"key":"2_CR48","unstructured":"Skadi\u0146a, I., Vasi\u013cjevs, A., Skadi\u0146\u0161, R., Gaizauskas, R., Tufi\u015f, D., & Gornostay, T. (2010). Analysis and evaluation of comparable corpora for under resourced areas of machine translation. Proceedings of the 3rd Workshop on Building and Using Comparable Corpora. Applications of Parallel and Comparable Corpora in Natural Language Engineering and the Humanities (pp. 6\u201314), Valletta, Malta."},{"key":"2_CR49","unstructured":"Smith, J., Quirk, C., & Toutanova, K. (2010). Extracting parallel sentences from comparable corpora using document level alignment. Proceedings of NAACL 2010, Los Angeles, CA."},{"key":"2_CR50","unstructured":"Steinberger, R., Pouliquen, B., Widiger, A., Ignat, C., & Tufi\u015f, D. (2006). The JRC- Acquis: A multilingual aligned parallel corpus with 20+ languages. Proceedings of LREC 2006, Genoa, Italy."},{"key":"2_CR51","doi-asserted-by":"publisher","first-page":"238","DOI":"10.1093\/ijl\/9.3.238","volume":"9","author":"W Teubert","year":"1996","unstructured":"Teubert, W. (1996). Comparable or parallel corpora? International Journal of Lexicography, 9, 238\u2013264.","journal-title":"International Journal of Lexicography"},{"key":"2_CR60","first-page":"34","volume":"1","author":"J Tom\u00e1s","year":"2008","unstructured":"Tom\u00e1s, J., Bataller, J., Casacuberta, F., & Lloret, J. (2008). Mining Wikipedia as a parallel and comparable corpus. Language Forum, 1, 34.","journal-title":"Language Forum"},{"key":"2_CR53","unstructured":"Vidulin, V., Lustrek, M., & Gams, M. (2007). Using genres to improve search engines. Proceedings of the International Workshop Towards Genre-Enable Search Engines: The Impact of Natural Language Processing (pp. 45\u201351)."},{"key":"2_CR54","doi-asserted-by":"publisher","first-page":"257","DOI":"10.1007\/11562214_23","volume":"3651","author":"D Wu","year":"2005","unstructured":"Wu, D., & Fung, P. (2005). Inversion transduction grammar constraints for mining parallel sentences from quasi-comparable corpora. Natural Language Processing IJCNLP 2005, 3651, 257\u2013268.","journal-title":"Natural Language Processing IJCNLP 2005"},{"key":"2_CR55","unstructured":"Wu, Z., Markert, K., & Sharoff, S. (2010). Fine-grained genre classification using structural learning algorithms. Proceedings of the 48th Annual Meeting of the Association for Computational Linguistics (pp. 749\u2013759)."},{"key":"2_CR56","unstructured":"Xu, J., Deng, Y., Gao, Y., & Ney, H. (2007). Domain dependent machine translation. Proceedings of the Machine Translation Summit XI, Copenhagen, Denmark."},{"key":"2_CR57","doi-asserted-by":"crossref","unstructured":"Yu, K., & Tsujii, J. (2009). Extracting bilingual dictionary from comparable corpora with dependency heterogeneity. Proceedings of HLT-NAACL 2009, Boulder, CO.","DOI":"10.3115\/1620853.1620888"},{"key":"2_CR58","unstructured":"Zesch, T., M\u0171ller, C., & Gurevych, I. (2008). Extracting lexical semantic knowledge from Wikipedia and Wikictionary. Proceedings of the LREC 2008, Marrakech, Morocco."}],"container-title":["Theory and Applications of Natural Language Processing","Using Comparable Corpora for Under-Resourced Areas of Machine Translation"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-99004-0_2","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,5,21]],"date-time":"2019-05-21T04:24:44Z","timestamp":1558412684000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-99004-0_2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019]]},"ISBN":["9783319990033","9783319990040"],"references-count":59,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-99004-0_2","relation":{},"ISSN":["2192-032X","2192-0338"],"issn-type":[{"type":"print","value":"2192-032X"},{"type":"electronic","value":"2192-0338"}],"subject":[],"published":{"date-parts":[[2019]]},"assertion":[{"value":"7 February 2019","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}}]}}