Репозитарій КНУ
Увійти(current)
  1. Головна
  2. Наукова періодика | Scientific periodicals
  3. Вісник Київського національного університету імені Тараса Шевченка. Серія фізико-математичні науки | Bulletin of Taras Shevchenko National University of Kyiv. Series: Physics and Mathematics
  4. 2025
  5. Вісник Київського національного університету імені Тараса Шевченка. Фізико-математичні науки. Том 80 № 1
  6. Моделі глибокого навчання для вирішення задачі порівняння неструктурованої текстової інформації

Моделі глибокого навчання для вирішення задачі порівняння неструктурованої текстової інформації

Тип публікації :
Стаття
Дата випуску :
7 липня 2025 р.
Автор(и) :
Skliarenko, Оlena
Pashko, Аnatolii
Скляренко, Олена
Пашко, Анатолій  
Литвиненко, Леонід
Колодінська, Яніна
Мова основного тексту :
Англійська
eKNUTSHIR URL :
https://ir.library.knu.ua/handle/15071834/25782
DOI :
10.17721/1812-5409.2025/1.21
Журнал :
Bulletin of Taras Shevchenko National University of Kyiv. Physics and Mathematics  
Том :
80
Випуск :
1
ISSN :
1812-5409
Початкова сторінка :
157
Кінцева сторінка :
163
Цитування :
[APA 7] Skliarenko, О., Pashko, А., Скляренко, О., Пашко, А., Литвиненко, Л., & Колодінська, Я. (2025). Deep learning models for solving the problem of comparing unstructured textual information. Bulletin of Taras Shevchenko National University of Kyiv. Physics and Mathematics, 80(1), 157–163. https://doi.org/10.17721/1812-5409.2025/1.21
[ДСТУ] Deep learning models for solving the problem of comparing unstructured textual information / О. Skliarenko et al. Bulletin of Taras Shevchenko National University of Kyiv. Physics and Mathematics. 2025. Vol. 80, no. 1. P. 157—163. DOI: 10.17721/1812-5409.2025/1.21 (date of access: 25.07.2026).
Присвячено застосуванню сучасних методів глибокого навчання, таких як універсальні багатомовні векторні представлення речень, для аналізу та порівняння схожості змісту неструктурованих текстових документів. Розроблено алгоритм визначення подібності багатомовних текстів за допомогою глибоких нейронних мереж. Авторами запропоновано безсупервізійний метод для швидкого аналізу та порівняння складних документів подібної тематики, написаних у різних країнах та різними мовами. Представлена методологія передбачає попереднє оброблення документів, їхнє переформатування для порівняння та застосування методів глибокого навчання для виявлення текстової схожості. Алгоритм відпрацьовано на прикладі здійснення порівняльного аналізу схожості за змістом текстів Податкового кодексу України з німецьким фіскальним кодексом. Український фіскальний код, поданий у форматі HTML, було оброблено за допомогою бібліотеки аналізу HTML документів і регулярних виразів, тоді як німецький фіскальний код у форматі PDF потребував спеціального аналізу неструктурованого змісту. У процесі дослідження для підвищення точності й подолання виявлених обмежень універсальних багатомовних векторних представленнь український документ було перекладено англійською мовою за допомогою Google Translate API. Розв'язання поставленої задачі потребує глибокого попереднього оброблення даних, що було здійснено у пропонованому дослідженні. Наведено також покроковий алгоритм представленої методології, що приводить до формування кореляційної таблиці, за якою визначається схожість між подібними різномовними текстовими документами. Крім того, автори доповнюють кожен крок своїми міркуваннями про те, як інтерпретувати проміжні результати та розуміти, чи варто коригувати метод відповідно до потреб або проблем конкретних документів, як-от застосування машинного перекладу чи розширеного попереднього оброблення.
Авторами запропоновано алгоритм для застосування зазначеного методу до фіскальних кодексів країн – членів Європейського Союзу або інших країн. У дослідженні виявлені й описані обмеження цього підходу, а також продемонстровано проведення перевірки проміжних результатів та здійснено доповнення методу додатковими можливостями задля підвищення його надійності. Крім цього, надано рекомендації щодо можливостей застосування запропонованої методології, зокрема розроблення алгоритмів для стандартизації певних документів країн Європейського Союзу.
Ключові слова :
deep learning universal vector representations of sentences financial documents fiscal code regular expressions глибоке навчання універсальні векторні представлення речень фінансові документи фіскальний код регулярні вирази
Файл(и) :
Вантажиться...
Ескіз
Завантажити
Формат :

Adobe PDF

Розмір :

2.58 MB

Контрольна сума :

(MD5):24e38c41130ca82f7ff40d7508b1c5fa

Creative Commons Attribution 4.0 International
Якщо не вказано інше, ця робота розповсюджується на умовах ліцензії Creative Commons Attribution 4.0 International
Контакти
  • ir.library@knu.ua
  • (044) 239-33-30
  • м. Київ, вул. Володимирська, 58, к. 42

Побудовано за допомогою Програмне забезпечення DSpace-CRIS - Розширення підтримується та оптимізується 4Наука

  • Доступність
  • Політика приватності
  • Угода користувача
  • Надіслати відгук