Cинтез та конверсія українського співочого мовлення
Тип публікації :
Бакалаврська робота
Дата випуску :
10 жовтня 2025 р.
Автор(и) :
Грицишин, Яна
Науковий(і) керівник(и)/редактор(и) :
Мова основного тексту :
Ukrainian
eKNUTSHIR URL :
Цитування :
[APA 7] Грицишин, Я. (2025). Cинтез та конверсія українського співочого мовлення. [Бакалаврська робота, Київський національний університет імені Тараса Шевченка]. eKNUTSHIR. https://ir.library.knu.ua/handle/15071834/25662
[ДСТУ] Грицишин Я. Cинтез та конверсія українського співочого мовлення : кваліфікаційна робота бакалавра : 03 Гуманітарні науки / наук. кер. В. В. Робейко. Київ, 2025. 67 с. URL: https://ir.library.knu.ua/handle/15071834/25662 (дата звернення: 17.07.2026).
Синтез співочого мовлення (SVS) – перспективний напрям у галузі комп’ютерної лінгвістики, акустики та штучного інтелекту, який значно покращився завдяки розвитку нейронних мереж. Однак, попри розвиток японських, китайських та англомовних SVS-систем, українськомовні відкриті аналоги ще не створені. Окрім цього, окремо привертає увагу розвиток технологій клонування голосу, що дозволяють створювати персоналізовані голосові моделі.
Кваліфікаційна робота присвячена аналізу і розробці українських SVS- та SVC-систем, а також оцінка якості синтезу. Проєкт має важливе практичне значення для музики, кінематографу, реклами, а також для академічних досліджень українського співочого мовлення, сприяючи популяризації мови в технологічному просторі.
В ході роботи було визначено диференційні ознаки співочого мовлення, надано коротку історію розвитку систем синтезу вокалу, описано провідні архітектури, а також створено і проаналізовано системи синтезу співочого мовлення за допомогою DiffSinger та систему клонування голосу на основі RVC-WebUI.
Згенеровані результати демонструють високу якість згенерованих фрагментів обома системами. DiffSinger більш гнучкий, добре зберігає тембр і контроль над ритмом, але потребує багато ресурсів і має окремі артефакти у звучанні. RVC-WebUI бере на вхід реальні записи, забезпечує природність звучання, але наявність артефактів залежить від якості вхідних даних і не дає контролю над змістом. Хоч кожна з них і має свої недоліки, обидва підходи виявились ефективними за різних умов та завдань. Їх поєднання може підвищити гнучкість і якість синтезу.
Кваліфікаційна робота присвячена аналізу і розробці українських SVS- та SVC-систем, а також оцінка якості синтезу. Проєкт має важливе практичне значення для музики, кінематографу, реклами, а також для академічних досліджень українського співочого мовлення, сприяючи популяризації мови в технологічному просторі.
В ході роботи було визначено диференційні ознаки співочого мовлення, надано коротку історію розвитку систем синтезу вокалу, описано провідні архітектури, а також створено і проаналізовано системи синтезу співочого мовлення за допомогою DiffSinger та систему клонування голосу на основі RVC-WebUI.
Згенеровані результати демонструють високу якість згенерованих фрагментів обома системами. DiffSinger більш гнучкий, добре зберігає тембр і контроль над ритмом, але потребує багато ресурсів і має окремі артефакти у звучанні. RVC-WebUI бере на вхід реальні записи, забезпечує природність звучання, але наявність артефактів залежить від якості вхідних даних і не дає контролю над змістом. Хоч кожна з них і має свої недоліки, обидва підходи виявились ефективними за різних умов та завдань. Їх поєднання може підвищити гнучкість і якість синтезу.
Галузі знань та спеціальності :
03 Гуманітарні науки
03 Гуманітарні науки::035 Філологія
Галузі науки і техніки (FOS) :
Гуманітарні науки
Мови та література
Лінгвістика
Файл(и) :![Ескіз]()
Вантажиться...
Формат :
Adobe PDF
Розмір :
4.1 MB
Контрольна сума :
(MD5):a5d672c74d18f31b5df088c2208a59d6
Якщо не вказано інше, ця робота розповсюджується на умовах ліцензії Creative Commons Attribution-NonCommercial 4.0 International

