{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,16]],"date-time":"2026-03-16T10:05:10Z","timestamp":1773655510554,"version":"3.50.1"},"reference-count":60,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2010,9,29]],"date-time":"2010-09-29T00:00:00Z","timestamp":1285718400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IJDAR"],"published-print":{"date-parts":[[2010,12]]},"DOI":"10.1007\/s10032-010-0128-2","type":"journal-article","created":{"date-parts":[[2010,9,28]],"date-time":"2010-09-28T05:41:55Z","timestamp":1285652515000},"page":"285-302","source":"Crossref","is-referenced-by-count":23,"title":["Building a multi-modal Arabic corpus (MMAC)"],"prefix":"10.1007","volume":"13","author":[{"given":"Ashraf","family":"AbdelRaouf","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Colin A.","family":"Higgins","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tony","family":"Pridmore","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mahmoud","family":"Khalil","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2010,9,29]]},"reference":[{"issue":"1","key":"128_CR1","first-page":"71","volume":"35","author":"H. Ku\u010dera","year":"1967","unstructured":"Ku\u010dera H., Francis W.N.: Computational analysis of present-day American English. Int. J. Am. Linguist. 35(1), 71\u201375 (1967)","journal-title":"Int. J. Am. Linguist."},{"key":"128_CR2","unstructured":"Davies, M.: (1990-present) The corpus of contemporary American english (COCA), 410+ Million words. http:\/\/www.americancorpus.org (2008)"},{"key":"128_CR3","unstructured":"The British National Corpus: Oxford University. http:\/\/www.natcorp.ox.ac.uk (2005)"},{"key":"128_CR4","unstructured":"Time: Time archive 1923 to present. http:\/\/www.time.com\/time\/archive\/ (2008)"},{"key":"128_CR5","unstructured":"Knight, D., Bayoumi, S., Mills, S., Crabtree, A., Adolphs, S., Pridmore, T., Carter, R.: Beyond the text: building and analysing multi-modal corpora. In: 2nd International Conference on E-Social Science. Manchester, UK (2006)"},{"key":"128_CR6","unstructured":"Indexes : United nations documentation.: the Department of Public Information (DPI), Dag Hammarskj\u00f6ld Library (DHL). http:\/\/www.un.org\/Depts\/dhl\/resguide\/itp.htm (2007)"},{"key":"128_CR7","unstructured":"Internet world users by language: Top ten languages used in the web. Internet World Stats, Usage and Population Statistics. http:\/\/www.internetworldstats.com\/stats7.htm . Accessed 22-01-07 (2007)"},{"key":"128_CR8","unstructured":"UCLA TUoC, Los Angeles: Arabic. International Institute, Center for World Languages, Language Materials Project. http:\/\/www.lmp.ucla.edu\/Profile.aspx?LangID=210&menu=004 (2006)"},{"key":"128_CR9","unstructured":"Hamada, S.: . In: The Seventh Conference on Language Engineering. Cairo, Egypt (2007)"},{"issue":"5","key":"128_CR10","doi-asserted-by":"crossref","first-page":"712","DOI":"10.1109\/TPAMI.2006.102","volume":"28","author":"L.M. Lorigo","year":"2006","unstructured":"Lorigo L.M., Govindaraju V.: Offline Arabic handwriting recognition: a survey. IEEE Trans. Pattern Anal. Mach. Intell. 28(5), 712\u2013724 (2006)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"128_CR11","doi-asserted-by":"crossref","unstructured":"Amin, A.: Off line Arabic character recognition\u2014a survey. In: The Fourth International Conference on Document Analysis and Recognition, pp. 596\u2013599. Ulm, Germany (1997)","DOI":"10.1142\/9789812830968_0015"},{"key":"128_CR12","doi-asserted-by":"crossref","unstructured":"AbdelRaouf, A., Higgins, C., Khalil, M.: A database for Arabic printed character recognition. In: The International Conference on Image Analysis and Recognition-ICIAR 2008, P\u00f3voa de Varzim, Portugal, pp. 567\u2013578 (2008)","DOI":"10.1007\/978-3-540-69812-8_56"},{"key":"128_CR13","unstructured":"IRIS: Readiris pro 10 (2004)"},{"key":"128_CR14","volume-title":"Arabic Gigaword","author":"R. Parker","year":"2009","unstructured":"Parker R., Graff D., Chen K., Kong J., Maeda K.: Arabic Gigaword. Linguistic Data Consortium, University of Pennsylvania, Philadelphia (2009)"},{"key":"128_CR15","unstructured":"CLARA (Corpus Linguae Arabicae): Charles University, Prague (2001)"},{"key":"128_CR16","unstructured":"Al-Hayat newspaper, Al-Hayat Arabic data set, University of Essex, in collaboration with the Open University"},{"key":"128_CR17","unstructured":"An-Nahar newspaper: An-Nahar text corpus (2000)"},{"key":"128_CR18","doi-asserted-by":"crossref","unstructured":"Slimane, F., Ingold, R., Kanoun, S., Alimi, A.M., Hennebert, J.: A new Arabic printed text image database and evaluation protocols. In: 10th International Conference on Document Analysis and Recognition, pp. 946\u2013950. Barcelona, Spain (2009)","DOI":"10.1109\/ICDAR.2009.155"},{"key":"128_CR19","doi-asserted-by":"crossref","unstructured":"Abbes, R., Dichy, J., Hassoun, M.: The architecture of a standard Arabic lexical database. Some figures, ratios and categories from the DIINAR.1 source program. In: Workshop of Computational Approaches to Arabic Script-based Languages, pp. 15\u201322. Geneva, Switzerland (2004)","DOI":"10.3115\/1621804.1621810"},{"key":"128_CR20","doi-asserted-by":"crossref","unstructured":"Beesley, K.R.: Arabic finite-state morphological analysis and generation. In: 16th International Conference on Computational Linguistics, pp. 89\u201394. Copenhagen (1996)","DOI":"10.3115\/992628.992647"},{"key":"128_CR21","unstructured":"Alansary, S., Nagi, M., Adly, N.: Building an International Corpus of Arabic (ICA): progress of compilation stage. In: The Seventh Conference on Language Engineering. Cairo, Egypt (2007)"},{"key":"128_CR22","unstructured":"Wynne, M.: Corpus and text\u2014basic principles. In: Developing Linguistic Corpora: A Guide to Good Practice. Oxbow Books, Oxford. Available online from http:\/\/ahds.ac.uk\/linguistic-corpora\/ (2005)"},{"key":"128_CR23","unstructured":"Dash, N.S., Chaudhuri, B.B.: Why do we need to develop corpora in Indian languages? In: the International Working Conference on Sharing Capability in Localisation and Human Language Technologies SCALLA-2001. Bangalore (2001)"},{"key":"128_CR24","doi-asserted-by":"crossref","unstructured":"Al-Shalabi, R., Evens, M.: A computational morphology system for Arabic. In: Workshop on Computational Approaches to Semitic Languages COLING-ACL98, pp. 66\u201372. Montreal (1998)","DOI":"10.3115\/1621753.1621765"},{"key":"128_CR25","unstructured":"The Unicode consortium: Arabic, range: 0600-06ff. The Unicode Standard, Version 5 (2007)"},{"key":"128_CR26","unstructured":"The Unicode consortium: The Unicode standard, version 4.1.0. In: pp. 195\u2013206. Boston, MA, Addison-Wesley (2003)"},{"key":"128_CR27","unstructured":"The Unicode consortium: Arabic shaping The Unicode Standard, Version 5 (2006)"},{"issue":"1","key":"128_CR28","doi-asserted-by":"crossref","first-page":"31","DOI":"10.1007\/s100440200004","volume":"5","author":"M.S. Khorsheed","year":"2002","unstructured":"Khorsheed M.S.: Off-line Arabic character recognition\u2014a review. Pattern Anal. Appl. 5(1), 31\u201345 (2002)","journal-title":"Pattern Anal. Appl."},{"issue":"2","key":"128_CR29","first-page":"81","volume":"10","author":"M.M.M. Fahmy","year":"2001","unstructured":"Fahmy M.M.M., Ali S.A.: Automatic recognition of handwritten Arabic characters using their geometrical features. J. Stud. Inform. Control Emphasis Useful Appl. Adv. Technol. 10(2), 81\u201398 (2001)","journal-title":"J. Stud. Inform. Control Emphasis Useful Appl. Adv. Technol."},{"key":"128_CR30","doi-asserted-by":"crossref","unstructured":"Buckwalter, T.: Issues in Arabic orthography and morphology analysis. In: The 20th International Conference on Computational Linguistics, COLING 2004, pp. 31\u201334. Geneva, Switzerland (2004)","DOI":"10.3115\/1621804.1621813"},{"issue":"2","key":"128_CR31","first-page":"156","volume":"1","author":"R. Harty","year":"2004","unstructured":"Harty R., Ghaddar C.: Arabic text recognition. Int. Arab. J. Inf. Technol. 1(2), 156\u2013163 (2004)","journal-title":"Int. Arab. J. Inf. Technol."},{"key":"128_CR32","unstructured":"Contributors, W.: Code page. From wikipedia, the free encyclopaedia. http:\/\/en.wikipedia.org\/w\/index.php?title=Code_page&oldid=87192444 . Accessed 22 \/01\/07 (2006)"},{"issue":"2","key":"128_CR33","first-page":"171","volume":"11","author":"N.H.F. Beebe","year":"1990","unstructured":"Beebe N.H.F.: Character set encoding. TUGboat 11(2), 171\u2013175 (1990)","journal-title":"TUGboat"},{"key":"128_CR34","unstructured":"arabo.com: Arabo Arab search engine and dictionary. http:\/\/www.arabo.com\/ . Accessed 12-01-07 (2005)"},{"key":"128_CR35","unstructured":"Ltd SP: Webzip 7.0. 7.0 edn (2006)"},{"key":"128_CR36","doi-asserted-by":"crossref","unstructured":"Larkey, L.S., Ballesteros, L., Connell, M.E.: Improving stemming for Arabic information retrieval: light stemming and co-occurrence analysis. In: 25th International Conference on Research and Development in Information Retrieval (SIGIR), pp. 269\u2013274 (2002)","DOI":"10.1145\/564376.564425"},{"key":"128_CR37","doi-asserted-by":"crossref","unstructured":"Kanungo, T., Resnik, P.: The bible, truth, and multilingual OCR evaluation. In: the SPIE Conference on Document Recognition and Retrieval VI, pp. 86\u201396. San Jose, CA (1999)","DOI":"10.1117\/12.335806"},{"issue":"9","key":"128_CR38","doi-asserted-by":"crossref","first-page":"2127","DOI":"10.1016\/j.patcog.2008.10.031","volume":"42","author":"Y. Chang","year":"2009","unstructured":"Chang Y., Chen D., Zhang Y., Yang J.: An image-based automatic Arabic translation system. Pattern Recognit. 42(9), 2127\u20132134 (2009)","journal-title":"Pattern Recognit."},{"key":"128_CR39","doi-asserted-by":"crossref","unstructured":"Kanoun, S., Alimi, A.M., Lecourtier, Y.: Affixal approach for Arabic decomposable vocabulary recognition: A validation on printed word in only one font. In: The Eight International Conference on Document Analysis and Recognition (ICDAR\u201905), pp. 1025\u20131029. Seoul, Korea (2005)","DOI":"10.1109\/ICDAR.2005.44"},{"issue":"2","key":"128_CR40","doi-asserted-by":"crossref","first-page":"610","DOI":"10.1214\/aoms\/1177706645","volume":"29","author":"G.E.P. Box","year":"1958","unstructured":"Box G.E.P., Muller M.E.: A note on the generation of random normal deviates. Ann. Math. Stat. 29(2), 610\u2013611 (1958)","journal-title":"Ann. Math. Stat."},{"key":"128_CR41","unstructured":"Sonka, M., Hlavac, V., Boyle, R.: Image Processing: Analysis and Machine Vision, 2nd edition edn. Thomson Learning Vocational (1998)"},{"key":"128_CR42","doi-asserted-by":"crossref","unstructured":"Hartley, R.T., Crumpton, K.: Quality of OCR for degraded text images. In: The Fourth ACM Conference on Digital Libraries, pp. 228\u2013229 Berkeley, California, United States (1999)","DOI":"10.1145\/313238.313387"},{"issue":"3","key":"128_CR43","doi-asserted-by":"crossref","first-page":"811","DOI":"10.1016\/S0031-3203(02)00101-2","volume":"36","author":"C.H. Leea","year":"2003","unstructured":"Leea C.H., Kanungob T.: The architecture of trueViz: a grounDTRUth=metadata editing and vIsualiZing toolKit. Pattern Recognit. 36(3), 811\u2013825 (2003)","journal-title":"Pattern Recognit."},{"key":"128_CR44","doi-asserted-by":"crossref","unstructured":"Mehran, R., Pirsiavash, H., Razzazi, F.: A front-end OCR for omni-font Persian\/Arabic cursive printed documents. In: Digital Image Computing: Techniques and Applications (DICTA\u201905), pp 56\u201364. Cairns, Australia (2005)","DOI":"10.1109\/DICTA.2005.3"},{"key":"128_CR45","doi-asserted-by":"crossref","unstructured":"Najoua, B.A., Noureddine, E.: A robust approach for Arabic printed character segmentation. In: Third International Conference on Document Analysis and Recognition (ICDAR\u201995), pp. 865\u2013868. Montreal, Canada, (1995)","DOI":"10.1109\/ICDAR.1995.602038"},{"issue":"3","key":"128_CR46","doi-asserted-by":"crossref","first-page":"167","DOI":"10.1016\/S0262-8856(96)01119-5","volume":"15","author":"B.M.F. Bushofa","year":"1997","unstructured":"Bushofa B.M.F., Spann M.: Segmentation and recognition of Arabic characters by structural classification. Image Vis Comput. 15(3), 167\u2013179 (1997)","journal-title":"Image Vis Comput."},{"issue":"1","key":"128_CR47","doi-asserted-by":"crossref","first-page":"31","DOI":"10.1145\/375360.375365","volume":"33","author":"G. Navarro","year":"2001","unstructured":"Navarro G.: A guided tour to approximate string matching. ACM Comput. Surv. (CSUR) 33(1), 31\u201388 (2001)","journal-title":"ACM Comput. Surv. (CSUR)"},{"key":"128_CR48","doi-asserted-by":"crossref","unstructured":"Tanner, S., Mu\u00f1oz, T., Ros, P.H.: Measuring mass text digitization quality and usefulness. D-Lib Mag. 15(7\/8), (2009)","DOI":"10.1045\/july2009-munoz"},{"key":"128_CR49","unstructured":"Buckwalter, T.: Arabic word frequency counts. http:\/\/www.qamus.org\/wordlist.htm . Accessed 28\/01\/07 (2002)"},{"key":"128_CR50","unstructured":"Kilgarriff, A.: Using word frequency lists to measure corpus homogeneity and similarity between corpora. In: The 5th ACL Workshop on Very Large Corpora, pp. 231\u2013245. Beijing and Hong Kong (1997)"},{"key":"128_CR51","doi-asserted-by":"crossref","unstructured":"AL-Ma\u2019adeed, S., Elliman, D., Higgins, C.A.: A data base for Arabic handwritten text recognition research. In: Eighth International Workshop on Frontiers in Handwriting Recognition, pp. 485\u2013489 Ontario, Canada (2002)","DOI":"10.1109\/IWFHR.2002.1030957"},{"key":"128_CR52","unstructured":"Pechwitz, M., Maddouri, S.S., M\u00e4rgner, V., Ellouze, N., Amiri, H.: IFN\/ENIT\u2014Database of handwritten Arabic words. In: The 7th Colloque International Francophone sur l\u2019Ecrit et le Document, CIFED 2002, pp. 129\u2013136. Hammamet, Tunisia (2002)"},{"key":"128_CR53","unstructured":"Mashali, S., Mahmoud, A., Elnemr, H., Ahmed, G., Osama, S.: Arabic OCR database development. In: The Fifth Conference on Language Engineering, pp. 250\u2013283. Cairo, Egypt (2005)"},{"key":"128_CR54","unstructured":"Hyams, D.G.: CurveExpert 1.3, a comprehensive curve fitting system for windows (2005)"},{"key":"128_CR55","doi-asserted-by":"crossref","unstructured":"Gu, B., Hu, F., Liu, H.: Modelling classification performance for large data sets, an empirical study. In: Advances in web-age information management: second international conference, waim 2001, pp. 317\u2013328. xi\u2019an, china (2001)","DOI":"10.1007\/3-540-47714-4_29"},{"key":"128_CR56","unstructured":"contributors, W.: Romanization of Arabic. From wikipedia, the free encyclopaedia. http:\/\/en.wikipedia.org\/wiki\/Arabic_transliteration . Accessed 27\/01\/07 (2006)"},{"key":"128_CR57","unstructured":"contributors, W.: Arabic chat alphabet. From wikipedia, the free encyclopaedia. http:\/\/en.wikipedia.org\/wiki\/Arabic_Chat_Alphabet . Accessed 27\/01\/07 (2006)"},{"key":"128_CR58","doi-asserted-by":"crossref","unstructured":"Palfreyman, D., Khalil, M.a.: A funky language for teenzz to use: representing gulf Arabic in instant messaging. J. Comput. Mediat. Commun. 9(1) (2003)","DOI":"10.1111\/j.1083-6101.2003.tb00355.x"},{"key":"128_CR59","unstructured":"Buckwalter, T.: Buckwalter Arabic transliteration. http:\/\/www.qamus.org\/transliteration.htm . Accessed 28\/01\/07 (2002)"},{"key":"128_CR60","unstructured":"Ananthakrishnan, S., Bangalore, S., Narayanan, S.: Automatic diacritization of Arabic transcripts for automatic speech recognition. In: International Conference on Natural Language Processing. Kanpur, India (2005)"}],"container-title":["International Journal on Document Analysis and Recognition (IJDAR)"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-010-0128-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s10032-010-0128-2\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-010-0128-2","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,26]],"date-time":"2025-02-26T03:12:08Z","timestamp":1740539528000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s10032-010-0128-2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2010,9,29]]},"references-count":60,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2010,12]]}},"alternative-id":["128"],"URL":"https:\/\/doi.org\/10.1007\/s10032-010-0128-2","relation":{},"ISSN":["1433-2833","1433-2825"],"issn-type":[{"value":"1433-2833","type":"print"},{"value":"1433-2825","type":"electronic"}],"subject":[],"published":{"date-parts":[[2010,9,29]]}}}