Хеджирование американских пут-опционов глубоким обучением с подкреплением
Рейли Пикард · Department of Mechanical and Industrial Engineering, University of Toronto
Финн Вреденхаген, Хулио ДеХесус, Марио Шленер · Ernst & Young LLP, Торонто
Юрий Лавришин · Department of Chemical Engineering and Applied Chemistry, University of Toronto · апрель 2024
Оригинал: Pickard, R., Wredenhagen, F., DeJesus, J., Schlener, M. and Lawryshyn, Y. «Hedging American Put Options with Deep Reinforcement Learning», 2024 — arxiv.org/abs/2405.06774 (PDF).
Оригинал распространяется по лицензии CC BY-NC-SA 4.0; перевод выполнен на её условиях.
Ключевые слова: обучение с подкреплением; нейросети; ценообразование деривативов; динамическое хеджирование; количественные финансы; риск-менеджмент.
Аннотация
DDPG для хеджирования американских путов. Сначала агенты учатся и тестируются на геометрическом броуновском движении (GBM) и обходят дельту Блэка–Шоулза, особенно при транзакционных издержках. Второй круг: 80 путов по 8 тикерам, для каждого тикера калибруется стохастическая волатильность, для каждого из 80 опционов — свой агент на симулированных путях этой модели. DRL бьёт BS-дельту и на тех же калиброванных путях, и на реализованной траектории актива между продажей и экспирацией. Заявлено как первые DRL-агенты именно под американский пут. Цену опциона на каждом шаге даёт модельно-агностическая интерполяция Чебышёва — каркас без привязки к конкретному процессу базового актива.
Введение
После продажи опциона хеджер гасит риск. Европейский пут — продажа дельты акций. Для европейца есть аналитика Блэка–Шоулза [Black and Scholes 1973]; непрерывный дельта-нейтральный портфель в модели убивает риск, на рынке ребаланс дискретный, волатильность не константа, есть комиссии. Хедж при трении — последовательные решения в неопределённости. DRL уже бьёт людей в играх [Mnih et al. 2013; Silver et al. 2016] и роботах [Lillicrap et al. 2015]. Обзор 17 работ по DRL-хеджу акций [Pickard and Lawryshyn 2023]: европейцы с комиссиями и стох. волатильностью — да; американцев нет. У американского пута нет формулы из-за досрочного исполнения, нужны численные методы [Hull 2012]. Этот пробел и закрывают DDPG-агенты.
Состояние, действие, награда — ниже. Обучение: 5000 эпизодов по 25 шагов. Награда требует цену опциона на каждом шаге: на GBM — интерполяция биномиального дерева; на стох. воле — Чебышёв [Glau, Mahlstedt, and Pötz 2018], без тысяч MC с текущего уровня до экспирации.
Кратко про RL
Агент в состоянии $s$ берёт $a$, получает $r$. Цель — ожидаемая отдача \[ G_t=r_{t+1}+\gamma r_{t+2}+\cdots+\gamma^{T-1}r_T. \] Политика $\pi(s)\to a$. $Q^\pi(s,a)=\mathbb{E}[G\mid a,s]$. SARSA: $Q(s,a)\leftarrow Q(s,a)+\alpha(r'+\gamma Q(s',a')-Q(s,a))$. Q-learning Watkins: вместо $Q(s',a')$ стоит $\max_{a'}Q(s',a')$. Таблица $|{\mathcal S}|\times|{\mathcal A}|$ не масштабируется; DQN аппроксимирует $Q(s,a;\theta)$ и минимизирует \[ L_i(\theta_i)=\mathbb{E}_{s,a}\bigl[(y_i-Q(s,a;\theta_i))^2\bigr]. \] Непрерывные действия — DDPG [Lillicrap et al. 2015]: актор-критик, таргет $y_i=r+\gamma Q'(s',\pi'(s');\theta^{Q'})$. Обзор хеджирования: Cao et al. (2021), Assa et al. (2021), Xu and Dai (2022), Fathi and Hientzsch (2023). Американский пут в этом списке отсутствует (Xu and Dai тренируют на эмпирике американцев, но не этот каркас DDPG+Чебышёв).
Методология
Агент
Актор и критик — полносвязные сети, два скрытых слоя по 64, ReLU. Актор: сигмоида в $[0,1]$, затем умножение на $-1$ (шорт акций под пут). Критик: линейный выход. Learning rate актора $5\times 10^{-6}$, критика $5\times 10^{-4}$. Состояние: цена актива, время до экспирации, текущий холдинг (прошлое действие) — как Kolm and Ritter, Cao et al., без BS-дельты в стейте (европейская дельта вредна американцу). Награда \[ R_t=-\bigl|A_t(S_t-S_{t-1})-(C_t-C_{t-1})\bigr|-\kappa(A_t-A_{t-1})^2 S_t, \] $\kappa=0.005$. Без комиссий оптимум — ноль. Линейный штраф Cao $\lambda|A_t-A_{t-1}|S_t$ на американце либо игнорирует косты, либо недохеджирует рано (опасно при досрочном исполнении). Квадрат сильнее бьёт крупные скачки позиции. На тесте комиссии линейные $\lambda|A_t-A_{t-1}|S_t$, как у Cao — реалистичнее обучения.
Контрагент в обучении не исполняет на границе: эпизод идёт ниже ожидаемой границы, чтобы агент видел эти цены.
GBM
\[ S_{t+\Delta t}=S_t\exp\Bigl((\mu-\tfrac12\sigma^2)\Delta t+\sigma\sqrt{\Delta t}\,Z_t\Bigr),\quad Z_t\sim\mathcal N(0,1). \] $\mu=5\%$, $\sigma=20\%$, $T=1$ год. Цена опциона — биномиальное американское дерево, интерполяция. Тест: 10 000 путей, 100 ребалансов, $S_0=K=100$ USD. Бенчмарки: биномиальный хедж \[ \beta_t=-\frac{C_t^u-C_t^d}{S_t^u-S_t^d} \] и европейская BS-дельта пута (не учитывает early exercise). $r=5\%$.
Стохастическая волатильность (адаптация SABR)
\[ \sigma_t=\sigma_{t-1}+\nu\sigma_{t-1}\Delta B_t,\qquad S_t=S_{t-1}+\mu S_{t-1}\Delta t+\sigma_t S_{t-1}\Delta W_t, \] с коррелированными броунами через $\rho$. У Хагана $\beta=1$ и без дрейфа; здесь добавлен $\mu$. Предварительный тест: $\rho=-0.4$ (leverage effect), $\nu=0.1$. Калибровка: Bloomberg composite, 17 августа 2023, 8 тикеров (AAPL, JNJ, MA, META, MSFT, NKE, NVDA, SPY), два срока (15 сен / 17 ноя 2023), по 5 страйков = 80 опционов. $\rho,\nu$ подгоняются trust-region: старт волы = implied, минимум разницы mid и среднего пей-оффа 10 000 путей. Калибруют на европейцах (без границы исполнения) — иначе граница требует уже калиброванных коэффициентов. Параметры тикера — среднее по его опционам.Чебышёв [Glau et al. 2018]: на сетке времени узлы Чебышёва между экстремумами путей; назад от $t_{N-1}$ к $t_0$ continuation vs exercise; граница — узлы, где упражнение оптимально. Потом цена в любой $(S,t)$ — интерполяция без нового MC. 5000×25 = 125 000 наборов симуляций LSMC на обучение были бы неприемлемы. На GBM граница Чебышёва совпадает с биномиальным деревом 5000 узлов (Exhibit 2, ATM пут 100 USD, 1 год).
P&L теста
\[ B_0=C_0-S_0 A_0,\qquad B_n=B_{n-1}e^{r\Delta t}-(A_n-A_{n-1})S_n-\lambda|A_{n-1}-A_n|S_n. \] При исполнении в $T^*$: финальный P&L $=B_{T^*-\Delta t}e^{r\Delta t}+S_{T^*}A_{T^*-\Delta t}-(K-S_{T^*})^+$. На калиброванных моделях бенчмарк только BS-дельта с подстановкой текущей $\sigma_t$. Эмпирика: Yahoo, 17 авг – 17 ноя 2023, по одному истинному пути на тикер.Результаты
| $\lambda=0\%$ | $\lambda=3\%$ | |||
|---|---|---|---|---|
| среднее | стд. | среднее | стд. | |
| DRL | −0,10 | 1,20 | −7,90 | 2,30 |
| BS-дельта | −0,36 | 1,02 | −8,97 | 3,24 |
| Бином | −0,12 | 0,86 | −10,26 | 4,33 |
Без комиссий DRL лучше BS (европейская дельта не видит early exercise), но не лучше бинома и имеет большую дисперсию. При 3% DRL лучший и по среднему, и по стд. На ранних шагах позиция близка к биному; BS недохеджирует. На резких движениях DRL запаздывает: недохедж на шипе, перехедж на провале — плата за squaring комиссий, и поэтому он выигрывает при $\lambda=3\%$.
| $\lambda=0\%$ | $\lambda=3\%$ | |||
|---|---|---|---|---|
| среднее | стд. | среднее | стд. | |
| DRL | −1,72 | 1,11 | −10,02 | 3,35 |
| BS-дельта | −1,99 | 1,16 | −11,00 | 4,39 |
| Бином | −1,73 | 1,31 | −12,42 | 5,79 |
Опцион продан слишком дёшево (вола в цене 20%, мир 24%). DRL всё равно лучше обоих бенчмарков при комиссиях.
| комиссия 0% | комиссия 3% | |||
|---|---|---|---|---|
| среднее | стд. | среднее | стд. | |
| DRL | 0,035 | 0,58 | −3,23 | 1,05 |
| BS-дельта | 0,042 | 0,44 | −3,79 | 1,39 |
Без комиссий BS чуть лучше по среднему и стд.; с 3% снова DRL. Калиброванные 80 агентов: Exhibits 14–15 усредняют среднее P&L по 5 страйкам (строки между тикерами несравнимы). При $\lambda=3\%$ среднее DRL лучше BS почти на всех тикер×срок, кроме NVDA 17 ноября (DRL −32,26 против BS −30,55). На истинных путях Yahoo DRL бьёт BS-дельту в 12 из 16 комбинаций тикер×срок (усреднение по 5 страйкам). Практический вывод авторов: корзину из 80 опционов можно хеджировать 80 отдельными агентами, обученными в день котировки. Следующий шаг — переучивать каждый день; плюс parametric study гиперпараметров — в литературе нет консенсуса.
Оговорки: 3% линейных комиссий — стресс, не типичный retail; один реализованный путь на тикер — не статистика по режимам; калибровка на европейцах, хедж американский; отдельный агент на каждый опцион, не одна политика на книгу.
Заключение
Пробел европейского DRL-хеджа закрыт американским путом на DDPG. Новизна награды — модуль рассогласования P&L плюс квадрат оборота. На GBM с комиссиями DRL бьёт BS и бином; при заниженной воле — тоже. На калиброванном SABR-подобном процессе Чебышёв даёт цену без LSMC. И симуляция, и истинный путь 2023 говорят, что BS-дельта не оптимум при трении. Каркас Чебышёва переносится на более сложные процессы базового актива.
Литература
- Assa, H., Kenyon, C., and Zhang, H. (2021). related DDPG hedging.
- Black, F. and Scholes, M. (1973). The pricing of options and corporate liabilities. JPE.
- Cao, J., Chen, J., Hull, J., and Poulos, Z. (2021). Deep hedging of derivatives using reinforcement learning. J. Financial Data Science.
- Chebyshev, P.L. (1864). Sur les questions de minima…
- Glau, K., Mahlstedt, M., and Pötz, C. (2018). A new approach for American option pricing: The dynamic Chebyshev method. SIAM J. Sci. Comput.
- Hagan, P.S., Kumar, D., Lesniewski, A.S., and Woodward, D.E. (2002). Managing smile risk. Wilmott. (SABR)
- Hull, J. (2012). Options, Futures, and Other Derivatives.
- Kolm, P.N. and Ritter, G. (2019). Dynamic replication and hedging: A reinforcement learning approach. J. Financial Data Science.
- Lillicrap, T.P., et al. (2015). Continuous control with deep reinforcement learning. arXiv:1509.02971. (DDPG)
- Longstaff, F.A. and Schwartz, E.S. (2001). Valuing American options by simulation: A simple least-squares approach. RFS.
- Mnih, V., et al. (2013). Playing Atari with deep reinforcement learning.
- Pickard, R. and Lawryshyn, Y. (2023). Deep reinforcement learning for dynamic stock option hedging: A review.
- Sutton, R.S. and Barto, A.G. (2018). Reinforcement Learning: An Introduction. 2nd ed.
- Watkins, C.J.C.H. (1989). Learning from delayed rewards. PhD thesis.
- Xu, X. and Dai, M. (2022). empirical American option DRL.
Перевод: основной текст. Приложение (Yahoo-ряды и 80 P&L) опущено. · arXiv:2405.06774 · лицензия CC BY-NC-SA 4.0