Донавчання моделі машинного перекладу для локалізації англомовних коміксів українською мовою
Тип публікації :
Бакалаврська робота
Дата випуску :
6 липня 2026 р.
Автор(и) :
Шевченко, Ілля Костянтинович
Науковий(і) керівник(и)/редактор(и) :
Мова основного тексту :
Ukrainian
eKNUTSHIR URL :
Цитування :
[APA 7] Шевченко, І. К. (2026). Донавчання моделі машинного перекладу для локалізації англомовних коміксів українською мовою [Бакалаврська робота, Київський національний університет імені Тараса Шевченка]. eKNUTSHIR. https://ir.library.knu.ua/handle/15071834/28661
[ДСТУ] Шевченко І. К. Донавчання моделі машинного перекладу для локалізації англомовних коміксів українською мовою : кваліфікаційна робота бакалавра : 03 Гуманітарні науки / наук. кер. В. В. Робейко. Київ, 2026. 57 с. URL: https://ir.library.knu.ua/handle/15071834/28661 (дата звернення: 30.07.2026).
Робота присвячена вузькоспеціалізованій адаптації моделі машинного перекладу для відтворення текстів англомовних коміксів українською мовою. Актуальність зумовлена зростанням попиту на україномовний локалізований контент, низькоресурсністю мовної пари англійська-українська та відсутністю спеціалізованих систем перекладу для жанру коміксів.
Об’єктом дослідження є корпус текстів англомовних коміксів та їх відповідники українською мовою. Предметом – процес і результати донавчання нейромережевої моделі «Dragoman» на вузькоспеціалізованих текстових даних. Мета роботи полягає у визначенні ефективності доменної адаптації порівняно з базовою та альтернативною системами. Для цього проаналізовано жанр комікс, розглянуто еволюцію підходів до машинного перекладу, обґрунтовано вибір моделі, сформовано спеціалізований корпус, проведено донавчання, автоматичне оцінювання та лінгвістичний аналіз помилок, також застосовано модель в умовах реального пайплайну.
Дослідження базується на корпусних, експериментальних та порівняльних методах та лінгвістичному аналізі. Паралельний корпус на 2000 сегментів підготовлено стратифікованою вибіркою з «COMICS TEXT+». Донавчання виконано методом LoRA-адаптації з 4-бітним квантуванням у Google Colaboratory. За метриками BLEU, TER, chrF та COMET донавчена модель переважає над базовими системами. Покращилося відтворення ідіом, розмовних реплік і кличного відмінка. Розроблено прикладний пайплайн із графічним інтерфейсом, що інтегрує систему розпізнавання тексту «ComiQ» та переклад. Наукова новизна полягає у першому досвіді донавчання української decoder-only моделі на корпусі коміксів.
Об’єктом дослідження є корпус текстів англомовних коміксів та їх відповідники українською мовою. Предметом – процес і результати донавчання нейромережевої моделі «Dragoman» на вузькоспеціалізованих текстових даних. Мета роботи полягає у визначенні ефективності доменної адаптації порівняно з базовою та альтернативною системами. Для цього проаналізовано жанр комікс, розглянуто еволюцію підходів до машинного перекладу, обґрунтовано вибір моделі, сформовано спеціалізований корпус, проведено донавчання, автоматичне оцінювання та лінгвістичний аналіз помилок, також застосовано модель в умовах реального пайплайну.
Дослідження базується на корпусних, експериментальних та порівняльних методах та лінгвістичному аналізі. Паралельний корпус на 2000 сегментів підготовлено стратифікованою вибіркою з «COMICS TEXT+». Донавчання виконано методом LoRA-адаптації з 4-бітним квантуванням у Google Colaboratory. За метриками BLEU, TER, chrF та COMET донавчена модель переважає над базовими системами. Покращилося відтворення ідіом, розмовних реплік і кличного відмінка. Розроблено прикладний пайплайн із графічним інтерфейсом, що інтегрує систему розпізнавання тексту «ComiQ» та переклад. Наукова новизна полягає у першому досвіді донавчання української decoder-only моделі на корпусі коміксів.
Галузі знань та спеціальності :
03 Гуманітарні науки
03 Гуманітарні науки::035 Філологія
Галузі науки і техніки (FOS) :
Гуманітарні науки
Мови та література
Лінгвістика
Файл(и) :![Ескіз]()
Вантажиться...
Формат :
Adobe PDF
Розмір :
1.56 MB
Контрольна сума :
(MD5):502afe3f5b23a3f42cd3af51f44dc763
