Моделі глибокого навчання для вирішення задачі порівняння неструктурованої текстової інформації
Тип публікації :
Стаття
Дата випуску :
7 липня 2025 р.
Автор(и) :
Skliarenko, Оlena
Pashko, Аnatolii
Скляренко, Олена
Литвиненко, Леонід
Колодінська, Яніна
Мова основного тексту :
Англійська
eKNUTSHIR URL :
Том :
80
Випуск :
1
ISSN :
1812-5409
Початкова сторінка :
157
Кінцева сторінка :
163
Цитування :
[APA 7] Skliarenko, О., Pashko, А., Скляренко, О., Пашко, А., Литвиненко, Л., & Колодінська, Я. (2025). Deep learning models for solving the problem of comparing unstructured textual information. Bulletin of Taras Shevchenko National University of Kyiv. Physics and Mathematics, 80(1), 157–163. https://doi.org/10.17721/1812-5409.2025/1.21
[ДСТУ] Deep learning models for solving the problem of comparing unstructured textual information / О. Skliarenko et al. Bulletin of Taras Shevchenko National University of Kyiv. Physics and Mathematics. 2025. Vol. 80, no. 1. P. 157—163. DOI: 10.17721/1812-5409.2025/1.21 (date of access: 25.07.2026).
Присвячено застосуванню сучасних методів глибокого навчання, таких як універсальні багатомовні векторні представлення речень, для аналізу та порівняння схожості змісту неструктурованих текстових документів. Розроблено алгоритм визначення подібності багатомовних текстів за допомогою глибоких нейронних мереж. Авторами запропоновано безсупервізійний метод для швидкого аналізу та порівняння складних документів подібної тематики, написаних у різних країнах та різними мовами. Представлена методологія передбачає попереднє оброблення документів, їхнє переформатування для порівняння та застосування методів глибокого навчання для виявлення текстової схожості. Алгоритм відпрацьовано на прикладі здійснення порівняльного аналізу схожості за змістом текстів Податкового кодексу України з німецьким фіскальним кодексом. Український фіскальний код, поданий у форматі HTML, було оброблено за допомогою бібліотеки аналізу HTML документів і регулярних виразів, тоді як німецький фіскальний код у форматі PDF потребував спеціального аналізу неструктурованого змісту. У процесі дослідження для підвищення точності й подолання виявлених обмежень універсальних багатомовних векторних представленнь український документ було перекладено англійською мовою за допомогою Google Translate API. Розв'язання поставленої задачі потребує глибокого попереднього оброблення даних, що було здійснено у пропонованому дослідженні. Наведено також покроковий алгоритм представленої методології, що приводить до формування кореляційної таблиці, за якою визначається схожість між подібними різномовними текстовими документами. Крім того, автори доповнюють кожен крок своїми міркуваннями про те, як інтерпретувати проміжні результати та розуміти, чи варто коригувати метод відповідно до потреб або проблем конкретних документів, як-от застосування машинного перекладу чи розширеного попереднього оброблення.
Авторами запропоновано алгоритм для застосування зазначеного методу до фіскальних кодексів країн – членів Європейського Союзу або інших країн. У дослідженні виявлені й описані обмеження цього підходу, а також продемонстровано проведення перевірки проміжних результатів та здійснено доповнення методу додатковими можливостями задля підвищення його надійності. Крім цього, надано рекомендації щодо можливостей застосування запропонованої методології, зокрема розроблення алгоритмів для стандартизації певних документів країн Європейського Союзу.
Авторами запропоновано алгоритм для застосування зазначеного методу до фіскальних кодексів країн – членів Європейського Союзу або інших країн. У дослідженні виявлені й описані обмеження цього підходу, а також продемонстровано проведення перевірки проміжних результатів та здійснено доповнення методу додатковими можливостями задля підвищення його надійності. Крім цього, надано рекомендації щодо можливостей застосування запропонованої методології, зокрема розроблення алгоритмів для стандартизації певних документів країн Європейського Союзу.
Файл(и) :![Ескіз]()
Вантажиться...
Формат :
Adobe PDF
Розмір :
2.58 MB
Контрольна сума :
(MD5):24e38c41130ca82f7ff40d7508b1c5fa
Якщо не вказано інше, ця робота розповсюджується на умовах ліцензії Creative Commons Attribution 4.0 International

