Репозитарій КНУ
  • Yкраї́нська
  • English
  • Увійти
    Новий користувач? Зареєструйтесь.Забули пароль?
Репозитарій КНУ
  • Фонди & Зібрання
  • Статистика
  • Yкраї́нська
  • English
  • Увійти
    Новий користувач? Зареєструйтесь.Забули пароль?
  1. Головна
  2. Наукова періодика | Scientific periodicals
  3. Вісник Київського національного університету імені Тараса Шевченка. Фізико-математичні науки | Bulletin of Taras Shevchenko National University of Kyiv. Series: Physics and Mathematics
  4. 2021
  5. Вісник Київського національного університету імені Тараса Шевченка. Фізико-математичні науки. № 3
  6. Sequential resource allocation in a stochastic environment: an overview and numerical experiments
 
  • Деталі
Параметри

Sequential resource allocation in a stochastic environment: an overview and numerical experiments

Тип публікації :
Стаття
Дата випуску :
2021
Автор(и) :
Джога, Андрій С.
Мова основного тексту :
English
eKNUTSHIR URL :
https://ir.library.knu.ua/handle/15071834/26093
DOI :
10.17721/1812-5409.2021/3.1
Журнал :
Bulletin of Taras Shevchenko National University of Kyiv. Physics and Mathematics 
Випуск :
3
ISSN :
1812-5409
Початкова сторінка :
13
Кінцева сторінка :
25
Цитування :
Джога, А. С. (2021). Sequential resource allocation in a stochastic environment: an overview and numerical experiments. Bulletin of Taras Shevchenko National University of Kyiv. Physics and Mathematics(3), 13–25. https://doi.org/10.17721/1812-5409.2021/3.1
In this paper, we consider policies for the sequential resource allocation under the multi-armed bandit problem in a stochastic environment. In this model, an agent sequentially selects an action from a given set and an environment reveals a reward in return. In the stochastic setting, each action is associated with a probability distribution with parameters that are not known in advance. The agent makes a decision based on the history of the chosen actions and obtained rewards. The objective is to maximize the total cumulative reward, which is equivalent to the loss minimization. We provide a brief overview of the sequential analysis and an appearance of the multi-armed bandit problem as a formulation in the scope of the sequential resource allocation theory. Multi-armed bandit classification is given with an analysis of the existing policies for the stochastic setting. Two different approaches are shown to tackle the multi-armed bandit problem. In the frequentist view, the confidence interval is used to express the exploration-exploitation trade-off. In the Bayesian approach, the parameter that needs to be estimated is treated as a random variable. Shown, how this model can be modelled with help of the Markov decision process. In the end, we provide numerical experiments in order to study the effectiveness of these policies.
Pages of the article in the issue: 13 - 25
Language of the article: Ukrainian
Ключові слова :

sequential analysis

multi-armed bandit pr...

regret minimization

послідовний аналіз

проблема багаторукого...

мінімізація втрат

Тип зібрання :
Publication
Файл(и) :
Ескіз недоступний
Формат

Adobe PDF

Розмір :

536.11 KB

Контрольна сума:

(MD5):4c1b84007293ecdfab10d9e48257efaf

Ця робота розповсюджується на умовах ліцензії Creative Commons CC BY

Налаштування куків Політика приватності Угода користувача Надіслати відгук

Побудовано за допомогою Програмне забезпечення DSpace-CRIS - Розширення підтримується та оптимізується 4Наука

м. Київ, вул. Володимирська, 58, к. 42

(044) 239-33-30

ir.library@knu.ua