O‘ZBEK VA INGLIZ TILLARIDAGI PARALLEL KORPUSDA FRAZEMALARNI MORFOLOGIK VA SEAMANTIK TEGLASH MODEL
DOI:
https://doi.org/10.65164/kvrt9e75Kalit so‘zlar:
o‘zbek–ingliz parallel korpusi, frazema, morfologik teglash, semantik teglash, iyerarxik tagset, frazemani lemmalash, n-gramm, PMI, JSON-schema, annotatorlar kelishuvi.Abstrak
Maqolada o‘zbek–ingliz frazemalar parallel korpusi uchun morfologik va semantik teglash modeli taqdim etiladi. Tadqiqotda 420 ta frazema juftligi asosida ikki qatlamli annotatsiya tizimi ishlab chiqilgan bo‘lib, bu tizim frazemaning semantik yaxlitligini saqlagan holda uning morfologik tuzilishini ham ko‘rsatadi. Model frazemalarni to‘g‘ri segmentlash va semantik tahlil qilish imkonini beradi, bu esa tarjima sifatini yaxshilashda va parallel korpuslarda frazemaning aniqligini oshirishda muhim ahamiyatga ega
Havolalar
[1] Haagsma H., Boss J., Nissim M. (2020). MAGPIE: A Large Corpus of Potentially Idiomatic
Expressions. Proceedings of the 12th Conference on Language Resources and Evaluation
(LREC 2020). – P. 279–287.
[2] Koehn P. Europarl: A Parallel Corpus for Statistical Machine Translation // Proceedings of the
10th Machine Translation Summit. – Phuket, Thailand: AAMT, 2005. – P. 79–86.
[3] Marcus, M. P., Santorini, B., & Marcinkiewicz, M. A. (1993). Building a Large Annotated
Corpus of English: The Penn Treebank. Computational Linguistics, 19(2), 313–330.
[4] Rayson, P., Archer, D., Piao, S., & McEnery, T. (2004). The UCREL semantic analysis system.
LREC’04 Workshop, 7–12.
[5] Tiedemann, J. (2012). Parallel Data, Tools and Interfaces in OPUS. LREC 2012, 2214–2218.
[6] O‘zbekiston Respublikasi Prezidentining “Davlat tilini yanada rivojlantirishga oid qoʻshimcha
chora-tadbirlar toʻgʻrisida”gi PQ-308-son qarori. 20.10.2025. https://lex.uz/uz/docs/-7776360
[7] Church K.W., Hanks P. Word Association Norms, Mutual Information, and Lexicography //
Computational Linguistics. 1990. – Vol. 16. – № 1. – P. 22–29.