Навчання з підкріпленням для генерації оптимальної стратегії агентів на прикладі задачі найшвидшого проходження маршруту транспортним засобом
Тип публікації :
Бакалаврська робота
Дата випуску :
2023
Автор(и) :
Золотарьова Марина
Мова основного тексту :
ua
eKNUTSHIR URL :
Цитування :
[APA 7] Золотарьова, М. (2023). Навчання з підкріпленням для генерації оптимальної стратегії агентів на прикладі задачі найшвидшого проходження маршруту транспортним засобом [Бакалаврська робота, Київський національний університет імені Тараса Шевченка]. eKNUTSHIR. https://ir.library.knu.ua/handle/123456789/5639
[ДСТУ] Золотарьова М. Навчання з підкріпленням для генерації оптимальної стратегії агентів на прикладі задачі найшвидшого проходження маршруту транспортним засобом : кваліфікаційна робота бакалавра : 12 Інформаційні технології. Київ, 2023. 41 с. URL: https://ir.library.knu.ua/handle/123456789/5639 (дата звернення: 25.07.2026).
Об’єкт розроблення програмного засобу : навчання агента для оптимального проходження дистанції у наближених до реального життя умовах.
У ході дослідження розглянуто методи обраного способу машинного навчання (обрано спосіб навчання з підкріпленням) і визначено доцільний для обраної задачі; обрано алгоритм для реалізації програми : в якості алгоритму навчання було обрано метод Proximal Policy Optimization (PPO), вибрано необхідні бібліотеки і компоненти та встановлено їх у середовище розробки; створено програму, що створює та навчає агентів розвʼязувати задану задачу у заданих умовах. Встановлено необхідні модулі та здійснена реалізація програми мовою Python.
Ключові слова : proximal policy optimization, агент, машинне навчання, навчання з підкріпленням, середовище, стратегія, трек.
У ході дослідження розглянуто методи обраного способу машинного навчання (обрано спосіб навчання з підкріпленням) і визначено доцільний для обраної задачі; обрано алгоритм для реалізації програми : в якості алгоритму навчання було обрано метод Proximal Policy Optimization (PPO), вибрано необхідні бібліотеки і компоненти та встановлено їх у середовище розробки; створено програму, що створює та навчає агентів розвʼязувати задану задачу у заданих умовах. Встановлено необхідні модулі та здійснена реалізація програми мовою Python.
Ключові слова : proximal policy optimization, агент, машинне навчання, навчання з підкріпленням, середовище, стратегія, трек.
Галузі знань та спеціальності :
12 Інформаційні технології
121 Інженерія програмного забезпечення
Файл(и) :![Ескіз]()
Вантажиться...
Формат :
Adobe PDF
Розмір :
2.24 MB
Контрольна сума :
(MD5):76d4c6bd0763c4af116d21e7a5db2071
Якщо не вказано інше, ця робота розповсюджується на умовах ліцензії Creative Commons Attribution-NonCommercial 4.0 International

