Алгоритмы глубокого обучения с подкреплением для хеджирования опционов
Андрей Нягу, Фредерик Годен, Лейла Коссейм · Университет Конкордия, Монреаль (департамент информатики и программной инженерии; департамент математики и статистики) · v2, 17 апреля 2025
Оригинал: Neagu, A., Godin, F., Kosseim, L. «Deep Reinforcement Learning Algorithms for Option Hedging», 2025 — arxiv.org/abs/2504.05521 (PDF).
Рисунки воспроизведены из оригинальной публикации. Оригинал распространяется по лицензии CC BY 4.0; перевод выполнен на её условиях, изменение по отношению к оригиналу — перевод на русский язык.
Аннотация
Динамическое хеджирование — финансовая стратегия, состоящая в периодических сделках с одним или несколькими активами ради компенсации риска, связанного с коррелированным обязательством. Алгоритмы глубокого обучения с подкреплением (DRL) применялись для поиска оптимальных решений задач динамического хеджирования, поставленных как задачи последовательного принятия решений. Однако большинство предшествующих работ оценивают результативность лишь одного-двух алгоритмов, что затрудняет объективное сравнение.
В этой работе мы сравниваем восемь алгоритмов DRL в контексте динамического хеджирования: градиент политики Монте-Карло (MCPG), проксимальную оптимизацию политики (PPO), четыре варианта глубокого Q-обучения (DQL) и два варианта глубокого детерминированного градиента политики (DDPG). Два из этих вариантов представляют новое применение к задаче динамического хеджирования. В экспериментах в качестве базовой линии используется дельта-хеджирование по Блэку — Шоулзу, а набор данных симулируется моделью GJR-GARCH(1,1).
Результаты показывают, что MCPG, а за ним PPO, дают наилучшие результаты по мере корневого полуквадратичного штрафа. Более того, MCPG — единственный алгоритм, превзошедший базовую линию дельта-хеджирования в рамках отведённого вычислительного бюджета, что, возможно, объясняется разреженностью вознаграждений в нашей среде.
1. Введение
Хеджирование — финансовая практика, при которой торгуются один или несколько активов ради минимизации риска, связанного с коррелированным финансовым обязательством. Динамическое хеджирование — подход, при котором хеджирующий портфель периодически ребалансируется, в отличие от статического, где позиция устанавливается в начале и остаётся неизменной до даты истечения обязательства. Динамическое хеджирование потенциально эффективнее минимизирует риск, поскольку допускает постоянную подстройку состава портфеля под меняющийся профиль риска хеджируемого обязательства. Задача динамического хеджирования может быть поставлена как задача последовательного принятия решений, а значит, к ней применимы методы DRL: состояния на каждом шаге представляют рыночные условия, а действия соответствуют числу единиц хеджирующего актива в портфеле.
1.1. Вклады
Основные вклады работы двояки: (1) мы даём стандартизованное сравнение результативности и временно́й эффективности наиболее широко используемых в литературе алгоритмов DRL для оптимизации динамического хеджирования; (2) мы оцениваем и анализируем результативность вариантов, ранее не исследовавшихся в этой литературе, а именно Dueling DQL и Dueling Double DQL.
2. Связанные работы
Первые работы, взявшиеся за динамическое хеджирование методами DRL, — Бюлер и соавторы (2019) и Гальперин (2020). Первая, основополагающая, вместе с рядом последующих использует градиент политики Монте-Карло. Этот подход напрямую выучивает оптимальную политику — отображение из состояний в действия, минимизирующее заданную меру риска, применённую к терминальной потере хеджирования.
С тех пор многие работы расширили это направление другими алгоритмами DRL. Ду и соавторы (2020) использовали алгоритмы на основе функции ценности, такие как глубокое Q-обучение, которые выучивают ценность выполнения любого действия в данном состоянии; оптимальная политика затем выводится выбором действия с наибольшей ценностью. Кроме того, алгоритм подогнанной Q-итерации используется в модели QLBS Гальперина.
Другие работы использовали алгоритмы «актор — критик», сочетающие подходы на основе политики и функции ценности: PPO, DDPG и Twin Delayed DDPG (TD3). Однако все они сосредоточены на оценке единственного алгоритма, что затрудняет стандартные сравнения. Насколько нам известно, Ду и соавторы (2020) — единственная работа, сравнивающая несколько алгоритмов, но и она ограничивается двумя: DQL и PPO.
3. Предварительные сведения
3.1. Финансовый контекст
Опцион — финансовый контракт, дающий право купить (колл) или продать (пут) актив, называемый базовым, в заданную дату $T$ (истечение) по заранее определённой цене $K$ (страйк). Движения цены базового актива вызывают рост или падение стоимости опциона. Эту корреляцию может использовать финансовая организация, выпустившая опцион, стоимость которого для неё есть обязательство. Чтобы компенсировать риск роста стоимости опциона, организация может периодически покупать или продавать единицы базового актива.
В нашей работе мы хеджируем продажу колл-опциона, за который получаем денежную сумму — премию $p_0$, — и хеджируем риск роста стоимости опциона, периодически корректируя число удерживаемых акций на каждом шаге $t = 0, 1, \ldots, T$.
Динамическое хеджирование как задача оптимизации. Для компенсации возможных потерь от продажи колл-опциона к моменту истечения $T$ формируется хеджирующий портфель из денежных средств и акций. Задача состоит в выборе стратегии $X = \{X_t\}_{t=1}^{T}$, минимизирующей возможный риск в момент $T$, где $X_t$ — число акций в портфеле на интервале $(t-1, t]$:
$$X^* = \arg\min_X \rho(R) \tag{1}$$
где $\rho$ — мера риска, отображающая случайную величину потери $R$ в число, а $R = -P_X$ — величина, противоположная общей прибыли $P_X$ в момент $T$ при стратегии $X$.
Мы используем меру риска — корневой полуквадратичный штраф (RSQP):
$$\rho_{\text{RSQP}}(R) = \sqrt{\mathbb{E}\left[R^2 \mathbb{1}_{\{R > 0\}}\right]} \tag{2}$$
где $\mathbb{1}_{\{R>0\}}$ — индикатор, равный 1 при $R > 0$ и 0 иначе. Популярный квадратичный штраф в качестве меры риска не рассматривается, поскольку у него есть недостаток: он штрафует и прибыли, в отличие от полуквадратичного аналога.
Пусть $M_t$ — сумма денежных средств в портфеле в момент $t$ непосредственно перед сделками. Поскольку все сделки с акциями финансируются из денежного резерва, портфель называется самофинансируемым. На каждом периоде резерв прирастает с множителем $e^{r_f}$, где $r_f$ — однопериодная безрисковая ставка:
$$M_t = \begin{cases} p_0 & \text{при } t = 0 \\ \left(M_{t-1} - c_t(X)\right)e^{r_f} & \text{при } t = 1, \ldots, T \end{cases} \tag{3}$$
причём суммарный объём сделки с акциями в момент $t$:
$$c_t(X) = \begin{cases} 0 & \text{при } t = 0 \\ S_{t-1}(X_t - X_{t-1}) & \text{при } t = 1, \ldots, T \end{cases} \tag{4}$$
где $S_t$ — цена базовой акции в момент $t$, а $X_0 = 0$.
Если в момент истечения $T$ цена базовой акции превышает страйк $K$, покупатель опциона исполнит своё право купить акцию по цене $K$. После реализации стратегии $X$ общая прибыль агента сразу после истечения:
$$P_X = S_T X_T + M_T - \mathbb{1}_E (S_T - K) \tag{5}$$
где $\mathbb{1}_E$ — индикатор, равный 1 при наступлении события $E \equiv \{S_T > K\}$.
Важная величина, используемая как переменная состояния, — стоимость портфеля:
$$V_t = S_t X_t + M_t \tag{6}$$
то есть сумма стоимости удерживаемых акций и денежных средств в момент $t$.
3.2. Рыночная среда
Определим процесс цены базовой акции $S = \{S_t\}_{t=0}^{T}$, положив $S_t = S_{t-1}\exp(Y_t)$, где $Y_t$ — логарифмическая доходность в момент $t$. Логарифмические доходности моделируются моделью GJR-GARCH(1,1):
$$Y_t = \mu + \varepsilon_t, \qquad \varepsilon_t = \sigma_t z_t \tag{7}$$
$$\sigma_t^2 = \nu_0 + \left(\nu + \lambda I_{t-1}\right)\varepsilon_{t-1}^2 + \xi\sigma_{t-1}^2, \qquad I_{t-1} = \begin{cases} 0 & \text{если } Y_{t-1} \ge \mu \\ 1 & \text{если } Y_{t-1} < \mu \end{cases}$$
где $\{\sigma_t^2\}$ — условные дисперсии логарифмических доходностей, $\{\mu, \lambda\} \in \mathbb{R}$ и $\{\nu_0, \nu, \xi\} \in \mathbb{R}^+$ — параметры модели, а $\{\varepsilon_t\}$ — ряд стандартных нормальных величин.
Модель GJR-GARCH(1,1) расширяет геометрическое броуновское движение классической модели Блэка — Шоулза, вводя стохастическую волатильность, кластеризацию волатильности и эффект рычага — черты, точнее отражающие поведение реальных цен.
3.3. Алгоритмы глубокого обучения с подкреплением
| Алгоритм | Тип | Пространство действий | Число гиперпараметров |
|---|---|---|---|
| DQL | на основе ценности | дискретное | 17 |
| Double DQL | на основе ценности | дискретное | 19 |
| Dueling DQL* | на основе ценности | дискретное | 17 |
| DD DQL* | на основе ценности | дискретное | 19 |
| MCPG | на основе политики | непрерывное | 9 |
| PPO | актор — критик | непрерывное | 17 |
| DDPG | актор — критик | непрерывное | 22 |
| TD3 | актор — критик | непрерывное | 27 |
Глубокое Q-обучение (DQL). DQL стало широко используемым алгоритмом с тех пор, как в 2013 году впервые превзошло человека на наборе игр Atari. Оно выводит оптимальную политику из функции ценности действия, получаемой из уравнения Беллмана. Оптимальная функция ценности действия есть ожидаемая отдача (сумма вознаграждений) при выполнении действия $a$ в состоянии $s$ и последующем следовании оптимальной политике $\pi^*$:
$$Q^*(s, a) = \mathbb{E}\left[\sum_{u=t}^{\infty}\gamma^{u-t} r_u \,\middle|\, s_t = s,\ a_t = a,\ (a_{u+1})_{u=t}^{\infty} \sim \pi^*\right]$$
где $\gamma$ — коэффициент дисконтирования. Оптимальная функция ценности представляется нейросетью с набором параметров $\phi$, оцениваемым итеративно.
Распространённая проблема DQL — склонность переоценивать ценность пар «состояние — действие». Для противодействия предложены варианты: Double DQL использует две разные функции ценности — одну для выбора действия, максимизирующего оценку, другую для оценки ценности этого действия. Dueling DQL разделяет функцию $Q$ на две части: функцию ценности состояния и функцию преимущества, отражающую относительную ценность конкретного действия по сравнению с прочими в том же состоянии. Это ведёт к лучшему обобщению, когда действия дают схожие вознаграждения, и к лучшему выявлению состояний, в которых действия существенно не влияют на среду.
Градиент политики Монте-Карло (MCPG). Классические методы на основе ценности склонны страдать от высокой вычислительной сложности при росте размерности задачи. Альтернатива — параметризовать политику напрямую, а не выводить её из функции ценности. Простой пример такого подхода — MCPG. Для улучшения политики многократно симулируется потеря хеджирования $R$ на текущей политике, и её распределение используется для оценки качества политики. Мы используем детерминированную политику $a \sim \pi(s; \theta)$. Параметры обновляются итеративно стохастическим градиентным спуском по батчам $R \equiv \{R_n\}_{n=1}^{N}$ независимых одинаково распределённых величин потерь:
$$\theta_{i+1} \leftarrow \theta_i - \alpha \nabla_{\theta_i}\hat\rho_{\text{RSQP}}(R) \tag{8}$$
где градиент эмпирической оценки меры RSQP вычисляется в замкнутой форме пакетами автоматического дифференцирования, а $\alpha$ — скорость обучения.
Глубокий детерминированный градиент политики (DDPG) — алгоритм «актор — критик». Вместо получения оптимальной политики как побочного продукта функции $Q$ он предлагает политику (актор), постепенно уточняемую с помощью оценённой функции ценности (критик). DDPG использует детерминированную политику $\pi(s; \theta)$, что снижает сложность по выборке, а функция $Q(s, a)$ текущей политики приближается нейросетью с параметрами $\phi$.
Преимущество DDPG перед DQL — естественная работа с непрерывными пространствами действий. В DQL нужно вычислять действие с максимальной ценностью $\max_a Q^*(s, a)$, что выполнимо для конечных дискретных пространств, но затруднительно (а порой неосуществимо) для непрерывных. Однако DDPG страдает той же проблемой переоценки. Для её смягчения предложен Twin Delayed DDPG (TD3): выучиваются две функции $Q$, и меньшее из двух значений используется как цель при обновлении; кроме того, обновления целевых параметров задерживаются.
Проксимальная оптимизация политики (PPO) разработана ради снижения дисперсии обновлений политики. Это алгоритм «актор — критик», обрезающий отношение вероятностей — меру того, насколько новая политика далека от предыдущей, — и тем самым штрафующий крупные обновления, предотвращая катастрофические изменения политики.
4. Постановка эксперимента
4.1. Базовая линия
Для оценки оптимальных стратегий $X^*$ мы сравниваем их с дельта-хеджированием по Блэку — Шоулзу:
$$X_{t+1} = \Phi(d_1), \quad t = 0, \ldots, T-1, \qquad d_1 = \frac{\log(S_t/K) + \left(r_f + \sigma^2/2\right)(T-t)\delta_t}{\sqrt{\sigma^2 (T-t)\delta_t}} \tag{9}$$
где $\Phi$ — функция стандартного нормального распределения, а $\delta_t$ — время (в годах) между двумя соседними моментами. В отсутствие транзакционных издержек, в непрерывном времени и при динамике, следующей геометрическому броуновскому движению, эта процедура полностью устраняет риск, чем и объясняется её популярность.
4.2. Финансовая постановка
В экспериментах хеджируется продажа стандартного колл-опциона со страйком $K = 100$ и годичным сроком с месячными шагами ($T = 12$, $\delta_t = 1/12$); мерой риска служит RSQP. Безрисковая ставка положена $r_f = 0$.
4.3. Постановка DRL
Данные. Алгоритмы обучались на симулированных ценовых траекториях, параметры GJR-GARCH(1,1) оценены методом максимального правдоподобия по месячным ценам S&P 500 с 15.11.2000 по 15.10.2024.
| $\mu$ | $\nu_0$ | $\nu$ | $\xi$ | $\lambda$ |
|---|---|---|---|---|
| 0,00533410 | 0,00018216 | 0,00026564 | 0,70611408 | 0,34275732 |
Подбор гиперпараметров выполнялся на 200 000 обновлений на валидационном наборе из $2^{17}$ траекторий; обучение — 500 000 обновлений на наборе из $2^{19}$ траекторий с ранней остановкой против переобучения; тестирование — на 10 различных тестовых наборах по $2^{17}$ траекторий каждый, с использованием среднего RSQP и его стандартного отклонения как меры качества. Политики и функции ценности приближаются полносвязными нейросетями прямого распространения.
Состояния. На каждом шаге $t$ состояние состоит из трёх переменных: нормированного текущего шага $t/T \in (0,1)$, нормированной текущей цены базовой акции $S_t/S_0 \in \mathbb{R}^+$ и нормированной стоимости хеджирующего портфеля $V_t/V_0 \in \mathbb{R}$.
Действия. Действие на шаге $t$ — число базовых акций $X_{t+1} \in \mathbb{R}$, которое надлежит удерживать далее. Однако, поскольку семейство DQL работает только с дискретными пространствами, действия дискретизируются как $X_{t+1} \in [0{,}00;\ 0{,}02;\ \ldots;\ 0{,}98;\ 1{,}00]$ — всего 51 возможное действие.
Рисунок 1 — смотреть в оригинале (PDF)
Эпизоды. На каждом шаге текущее состояние $s_t$ подаётся в алгоритм, который выдаёт действие $X_{t+1}$. Это повторяется до последнего шага, где вычисляется потеря хеджирования $R$. При обучении MCPG и PPO — алгоритмов Монте-Карло, опирающихся на целые эпизоды, — вознаграждение распространяется обратно во времени, поэтому нейросетевые аппроксиматоры политики содержат внутреннюю рекуррентную связь. Для аппроксиматоров функции ценности, обновляемых методом временных разностей, это не так.
Вознаграждения. Единственное вознаграждение в эпизоде — величина, противоположная асимметричной квадратичной потере хеджирования на последнем шаге $T$: $r_T = -R^2\mathbb{1}_{\{R>0\}}$. Мы берём противоположную величину, поскольку максимизация вознаграждения означает минимизацию риска. Ожидаемое вознаграждение оценивается эмпирически по мини-батчу размера $N$:
$$\mathbb{E}[r_T] = -\sqrt{\frac{1}{N}\sum_{n=1}^{N} R_n^2 \mathbb{1}_{\{R_n > 0\}}} \tag{10}$$
На всех предшествующих шагах вознаграждения нулевые: $r_t = 0$ при $t = 0, \ldots, T-1$. Вознаграждения в этой среде, таким образом, разрежены — по одному на эпизод.
Ранняя остановка. Алгоритмы обучались на обучающем наборе с проверкой на валидационном каждые 1000 обновлений. Обучение продолжается, пока не выполнены два условия: последние 5 зафиксированных валидационных RSQP выше шестого с конца, и все эти 6 значений ниже, чем у базовой линии. Дополнительно сохраняется модель с наименьшим валидационным RSQP, и именно она используется для вневыборочной оценки. Примечательно, что раннюю остановку запустил только алгоритм MCPG.
5. Результаты экспериментов
| Алгоритм | Средний RSQP | $p$-значение | Время (чч:мм) |
|---|---|---|---|
| MCPG | 0,8111 (0,0210) | 0,00 | 00:24 |
| Дельта-хедж Блэка — Шоулза (базовая линия) | 0,9038 (0,0074) | 0,00 | 00:00 |
| PPO | 0,9439 (0,0158) | 0,00 | 05:58 |
| TD3 | 1,0113 (0,0223) | 0,04 | 10:20 |
| DQL | 1,0278 (0,0119) | 0,00 | 06:32 |
| DDPG | 1,0467 (0,0089) | 0,00 | 09:37 |
| Dueling DQL* | 1,0745 (0,0095) | 0,00 | 06:07 |
| DD DQL* | 1,1111 (0,0109) | 0,00 | 06:23 |
| Double DQL | 1,1791 (0,0096) | — | 07:34 |
Наилучший по RSQP алгоритм — градиент политики Монте-Карло (0,8111), за ним PPO (0,9439). Это объясняется тем, что MCPG и PPO суть алгоритмы Монте-Карло, то есть выполняют шаг обновления по завершении эпизода. В контексте хеджирования опционов они показывают более высокую результативность, чем алгоритмы обучения по временным разностям.
Алгоритмы семейства DQL. Хотя DQL не превосходит базовую линию (1,0278 против 0,9038), его результат лежит между TD3 (1,0113) и DDPG (1,0467). Результат Dueling DQL незначительно хуже (1,0745), а Double DQL — существенно хуже (1,1791). Это указывает, что попытка выявлять состояния, где действия мало влияют (Dueling DQL), преимущества не даёт, а попытка исправить проблему переоценки (Double DQL) вредит результату. Комбинация обоих подходов, Dueling Double DQL, даёт 1,1111 — между Dueling и Double. Примечательно, что варианты DQL показывают наихудшие результаты из восьми алгоритмов, за исключением обычного DQL. Это можно отнести на счёт простоты последнего по сравнению с более сложными вариантами, что оказывается преимуществом при ограниченных вычислительных ресурсах: обычному DQL нужно выучить лишь функцию ценности действия, аппроксимируемую одной нейросетью, тогда как Dueling DQL должен выучить функцию ценности состояния и функцию преимущества на той же сети, а Double DQL требует оптимизации двух сетей.
Алгоритмы семейства DDPG. DDPG работает немного хуже DQL (1,0467 против 1,0278), что удивительно, поскольку он имеет преимущество естественной работы с непрерывными действиями: точность выходов не страдает от дискретизации и стратегия может быть тоньше. Причиной может быть сложность DDPG, который выучивает и политику, и функцию ценности действия двумя разными сетями, что требует не только обучения дополнительной сети, но и настройки лишних 5 гиперпараметров.
TD3 стремится решить проблему переоценки, беря минимум из двух функций ценности. Это лишь незначительно снижает RSQP по сравнению с обычным DDPG (1,0113 против 1,0467), что вновь указывает: проблема переоценки в нашей среде не слишком остра. При этом TD3 превосходит DQL (1,0113 против 1,0278), тогда как DDPG — нет. Впрочем, судя по $p$-значению 0,04, преимущество TD3 над DQL значимо лишь на 5-процентном уровне. Более того, этот выигрыш достаётся ценой существенно большего времени обучения (10:20 против 6:32) — и всё равно без превосходства над базовой линией.
Гиперпараметры
Гиперпараметры выбирались перебором по сетке: скорости обучения из [0,001; 0,0001; 0,00001], размеры батча из [64; 128; 256], число скрытых слоёв из [2; 3; 4] и размеры скрытого слоя из [64; 128; 256] — всего $3^4 = 81$ комбинация.
Интересно, что при подборе гиперпараметров 80 из 81 комбинации дали для MCPG валидационный RSQP ниже базовой линии, со значениями от 0,8142 до 0,9084. Отсюда вывод: MCPG устойчив к выбору гиперпараметров. Для PPO лишь три комбинации превзошли базовую линию при подборе (RSQP 0,8947; 0,8969 и 0,9032). Однако кривые валидационных потерь показали, что обучение для этих трёх было крайне нестабильным, с большими скачками RSQP. Поэтому таблица 5 построена по четвёртой лучшей комбинации, дающей гладкую и стабильную кривую обучения, но валидационный RSQP 0,9333 — то есть всё же не превосходящий базовую линию. Ни одна комбинация для прочих алгоритмов не смогла превзойти базовую линию в рамках отведённого вычислительного бюджета.
| Алгоритм | Скорость обучения | Размер батча | Скрытых слоёв | Размер слоя |
|---|---|---|---|---|
| MCPG | 0,00001 | 256 | 4 | 64 |
| PPO | 0,00001 | 128 | 2 | 256 |
| TD3 | 0,00001 | 64 | 4 | 256 |
| DQL | 0,00010 | 64 | 4 | 128 |
| DDPG | 0,00001 | 64 | 4 | 256 |
| Dueling DQL | 0,00010 | 128 | 3 | 256 |
| DD DQL | 0,00010 | 256 | 3 | 256 |
| Double DQL | 0,00010 | 64 | 4 | 64 |
Рисунок 2 — смотреть в оригинале (PDF)
6. Заключение и дальнейшая работа
Работа вносит вклад в область DRL для динамического хеджирования опционов тем, что (1) даёт эталонное сравнение целого набора алгоритмов: там, где предшествующие работы сосредоточены на одном-двух алгоритмах, мы сравниваем восемь, обеспечивая более целостную картину; (2) исследует результативность двух вариантов, ранее, насколько нам известно, не изучавшихся для этой задачи, — Dueling DQL и Dueling Double DQL.
Наша работа показывает, что алгоритм MCPG наилучшим образом снижает риск по мере RSQP, а вплотную за ним следует PPO. Однако только MCPG способен превзойти базовую стратегию дельта-хеджирования по Блэку — Шоулзу, тогда как PPO и все варианты DQL и DDPG этого не достигают. Кроме того, время обучения MCPG более чем в четырнадцать раз меньше, чем у ближайшего конкурента. Наши результаты показывают, что MCPG следует предпочитать на практике при решении задач глубокого хеджирования.
Одна из причин слабой результативности стратегий, порождаемых алгоритмами с функцией ценности, в том, что рассматриваемая задача поставлена как задача с разреженным вознаграждением. В дальнейшей работе можно было бы рассмотреть подход с разбиением единственного вознаграждения на части ради создания плотных вознаграждений; оценка того, улучшает ли это результативность алгоритмов на основе ценности, была бы уместной.
Кроме того, использованная среда низкоразмерна: мы хеджируем продажу колл-опциона единственным инструментом — базовой акцией, — поэтому число переменных состояния ограничено, а действия одномерны. Другие работы хеджируют продажу опциона несколькими инструментами (например, несколькими опционными контрактами) в более богатых пространствах состояний, где число входов и выходов может резко возрасти. Анализ того, сохраняется ли превосходство MCPG в задачах большей размерности, был бы интересен.
Наконец, реализация изученных алгоритмов для других задач последовательного принятия финансовых решений — оптимизации портфеля и оптимального исполнения — позволила бы оценить, влияет ли иная форма функции ценности, связанной с этими задачами, на результативность алгоритмов на основе ценности.
Литература
- F. Black, M. Scholes, The pricing of options and corporate liabilities, The Journal of Political Economy 81(3) (1973) 637–654.
- H. Buehler, L. Gonon, J. Teichmann, B. Wood, Deep hedging, Quantitative Finance 19(8) (2019) 1271–1291.
- J. Cao, J. Chen, J. Hull, Z. Poulos, Deep hedging of derivatives using reinforcement learning, Journal of Financial Data Science 3(1) (2020) 10–27.
- J. Cao и соавторы, Gamma and vega hedging using deep distributional reinforcement learning, Frontiers in Artificial Intelligence 6 (2023).
- A. Carbonneau, F. Godin, Equal risk pricing of derivatives with deep hedging, Quantitative Finance 21(4) (2021) 593–608.
- A. Carbonneau, F. Godin, Deep equal risk pricing (2024).
- L. R. Glosten, R. Jagannathan, D. E. Runkle, модель GJR-GARCH (1993).
- I. Halperin, QLBS: Q-learner in the Black-Scholes(-Merton) worlds (2020).
- S. Fujimoto, H. van Hoof, D. Meger, Addressing function approximation error in actor-critic methods (TD3), 2018.
- T. P. Lillicrap и соавторы, Continuous control with deep reinforcement learning (DDPG), ICLR (2016).
- V. Mnih и соавторы, Human-level control through deep reinforcement learning, Nature (2015).
- J. Schulman и соавторы, Proximal policy optimization algorithms, arXiv:1707.06347 (2017).
- R. S. Sutton и соавторы, Policy gradient methods for reinforcement learning with function approximation (1999).
- H. van Hasselt, A. Guez, D. Silver, Deep reinforcement learning with double Q-learning (2015).
- Z. Wang и соавторы, Dueling network architectures for deep reinforcement learning (2016).
Оригинал статьи: Neagu, A., Godin, F., Kosseim, L., «Deep Reinforcement Learning Algorithms for Option Hedging», arXiv:2504.05521 · лицензия CC BY 4.0