ARL-маркетмейкинг с расширенным пространством действий, процессами Хоукса и переменной волатильностью
Цзыи Ван, Кармине Вентре, Мария Полукарова · King’s College London · ICAIF ’24, 14–17 ноября 2024, Бруклин · arXiv: 7 августа 2025
Оригинал: Wang, Z., Ventre, C. and Polukarov, M. «ARL-Based Multi-Action Market Making with Hawkes Processes and Variable Volatility», 2024 — arxiv.org/abs/2508.16589 (PDF) · doi:10.1145/3677052.3698695.
Оригинал на arXiv по лицензии arXiv nonexclusive-distrib 1.0 (не Creative Commons); перевод для личной коллекции, не для публикации.
Ключевые слова: высокочастотная торговля; маркетмейкинг; лимитный стакан; стохастическое оптимальное управление; глубокое и состязательное обучение с подкреплением.
Аннотация
Авторы совмещают состязательное обучение с подкреплением (ARL), процессы Хоукса и два уровня волатильности, одновременно расширяя пространство действий маркетмейкера: котировать всегда, только с одной стороны или не котировать вовсе. Вместо привычного пуассоновского потока — Хоукс, который лучше ловит самовозбуждение реального рынка. Стратегии учат и проверяют при $\sigma=2$ и $\sigma=200$. Главный результат: 4-action MM, обученный в низкой воле, переносится на высокую, сохраняя стабильность и двусторонние котировки не менее 92% времени.
1. Введение
Маркетмейкеры дают ликвидность двусторонними котировками и зарабатывают на спреде, но живут в сложной среде с волатильной ценой. Spooner и Savani [27] показали, что ARL даёт агентов, устойчивых к эпистемической неопределённости: противник крутит параметры динамики и тем самым учит стратегию, которая держится в разных режимах. Wang, Ventre и Polukarov [30] сняли требование котировать на каждом шаге: двусторонние котировки, только bid, только ask или отказ.
Здесь два шага дальше. Во-первых, исполнение моделируют процессом Хоукса, а не Пуассоном: самовозбуждение ловит кластеры сделок и скачки цены. Во-вторых, сравнивают низкую ($\sigma=2$) и высокую ($\sigma=200$) волатильность — чтобы проверить, не разваливается ли стратегия в экстремуме.
Рис. 1: 4-action MM, обученный при $\sigma=2$ и проверенный при $\sigma=200$, остаётся относительно стабильным. Тот же 4-action, которого учили уже при $\sigma=200$, но на противнике и always-quoting политике с низкой волы, чаще отказывается котировать или встаёт в одну сторону — типичная мотивация «уйти с рынка», когда условия плохие.
Рисунок недоступен для встраивания — смотреть в оригинале
2. Обзор литературы
Стохастическое управление. Хо и Столл [19] — динамическое программирование оптимальных цен. Авельянеда и Стойков [3] — двухшаговая схема со стаканом и инвентарным риском. Guéant et al. [13] — ограничения на инвентарь; Fodra и Labadie [11] — риск-аверсия и разные mid-процессы. Cartea et al. [8] напоминают, что ошибка спецификации ломает «оптимум»; Guéant [12] — стратегии при модельной неопределённости.
RL. Chan и Shelton [9] — actor-critic в сложной среде. Abernethy и Kale [2] — онлайн-обучение с узким спредом. Spooner et al. [26] — высокоточный симулятор стакана и inventory-sensitive MM. Spooner и Savani [27] переводят одноагентную задачу в zero-sum с adversary. Wang et al. [30] — гибкое котирование. Jerome et al. [20] — модуль mbt_gym: векторизованные gym-среды для model-based торговли в стакане; оттуда же берут Хоукс-прибытие.
Хоукс. Классика Hawkes [17]; Hewlett [18] — двумерный Хоукс и импакт на FX; Large [21] — стакан; Toke и Pomponio [29] — trades-through. Обзоры Bacry et al. [4–7]. Abergel и Jedidi [1] — стакан на экспоненциальных ядрах; Lu и Abergel [22, 23] — высокоразмерный Хоукс потока. Составные процессы [14, 15, 28]; Roldan Contreras и Swishchuk [25] — оптимальные набор, ликвидация и маркетмейкинг в HFT.
Вклад этой работы: ARL + Хоукс + два режима волы + 4 действия. Четырёхакционный MM с низкой волы переносится на высокую.
3. Постановка
3.1. Динамика рынка
3.1.1. Цена. Каркас Авельянеды–Стойкова [3]. Цена — броуновское движение с дрейфом: \[ Z_{n+1}=Z_n+b_n\Delta t+\sigma_n W_n, \] $W_n\sim N(0,\Delta t)$. Старт $Z_0=100$; в базовых прогонах $\sigma_n=2$. Смещения котировок: \[ \delta_n^{\pm}=\pm(Z_n-P_n^{\pm})\ge 0, \] $P_n^+$ — bid MM, $P_n^-$ — ask.
3.1.2. Исполнение. Вероятность сделки на шаге — через интенсивность Хоукса и глубину:
\[
\lambda_n^{\pm}=\mathrm{Hawkes\_intensity}\cdot e^{-k_n^{\pm}\delta_n^{\pm}},\qquad k_n^{\pm}\gt 0.
\]
Интенсивность обновляется как в HawkesArrivalModel из [20]:
\[
\begin{aligned}
\mathrm{Hawkes\_intensity}
&\;\leftarrow\; \mathrm{Hawkes\_intensity}\\
&\;+\; \kappa\,(\bar\lambda-\mathrm{Hawkes\_intensity})\,\mathrm{d}t
\;+\; J\cdot \mathbf{1}_{\{\text{сделка}\}}.
\end{aligned}
\tag{1}
\]
Числа: скорость возврата $\kappa=60$, базовая интенсивность $\bar\lambda=10$, скачок $J=40$, шаг $\mathrm{d}t=0.005$.
3.1.3. Инвентарь и богатство. \[ \Pi(X,H,Z)=X+HZ,\qquad X_{n+1}=X_n+\delta_n^{-}\Delta N_n^{-}+\delta_n^{+}\Delta N_n^{+}-Z_n\Delta H_n, \] $H_n=N_n^{+}-N_n^{-}\in[\underline H,\overline H]$.
3.2. Участники
MM и противник — zero-sum: выигрыш противника равен минус выигрышу MM. Противник крутит три параметра: дрейф $b_n$, базовую интенсивность Хоукса $A_n^{\pm}$ и $k_n^{\pm}$ (распределение объёма).
Фиксированный. $b_n=0$, $A_n^{\pm}=10$, $k_n^{\pm}=1.5$ на всех эпизодах — стационарная одноагентная задача.
Случайный. В начале эпизода независимо равномерно: $b_n\in[-5,5]$, $A_n^{\pm}\in[7.5,12.5]$, $k_n^{\pm}\in[1.125,1.875]$, дальше константы.
Стратегический. Противник подбирает параметры, чтобы максимизировать свой (минус MM) выигрыш. Смотрят и «однопараметрических» противников: только $b$, только $A$ или только $k$.
Три агента MM.
- Always quoting: непрерывные смещения ask и bid в $[0,3]$.
- 2 действия: $\{0,1\}$ — молчать или котировать обе стороны.
- 4 действия: $\{0,1,2,3\}$ — молчать / обе стороны / только ask / только bid.
4. Обучение
Награда MM: \[ R_n=\Delta\Pi_n-\zeta H_n^2-\begin{cases}0,& t\lt T,\\ \eta H_n^2,& t=T.\end{cases} \] $\eta=\zeta=0$ — риск-нейтральный режим (RN); иначе риск-аверсный (RA). Семь наборов $(\eta,\zeta)$ в таблицах 1–7. Награда противника — с обратным знаком.
Сначала SAC [16] из tf_agents учит ALL-противника при $\sigma=2$: $\ge 50\,000$ эпизодов, обновление каждые 1000 шагов, learning rate $3\times 10^{-4}$ у актора и критика, батч 64. Действие противника $a=(b_n,A_n^{\pm},k_n^{\pm})$ в тех же диапазонах, что у случайного.
Затем тем же SAC — Always Quoting MM при $\sigma=2$ против уже обученного adversary; тест — фиксированный противник, $\sigma=2$. Multi-action агентов учат DQN: $\ge 50\,000$ эпизодов, обновление каждый шаг, learning rate $1\times 10^{-4}$, батч 64. 2-action и 4-action при $\sigma=2$ опираются на adversary и Always Quoting с $\sigma=2$. Отдельная ветка: 4-action учат при $\sigma=200$, но adversary и Always Quoting по-прежнему с $\sigma=2$. Потом меняют тип противника или $(\eta,\zeta)$ и повторяют.
5. Оценка
5.1. Метрики
Каждую стратегию гоняют 100 раз по 1000 эпизодов в фиксированной adversarial-среде. Четыре числа: терминальное богатство $\mathbb E[\Pi_N]\pm\sigma(\Pi_N)$; Шарп $\mathbb E[\Pi_N]/\sigma(\Pi_N)$; терминальный инвентарь $H_N$; доля котировок «молчание + двусторонние + только ask + только bid».
Пять колонок: Always Quoting (train/test $\sigma=2$); 2-action (2/2); 4-action (2/2); 4-action (train 2, test 200); 4-action (train/test 200, но adversary и Always Quoting с волы 2).
5.2. Результаты
Always Quoting, Хоукс vs Пуассон. Качественно как у [27, 30]: All-противник (три параметра) даёт лучший Шарп, чем Random, тот лучше Fixed; противник только по $b$ обычно сильнее Random. Противники только $A$ или только $k$ преимущества не дают. По среднему богатству и Шарпу Хоукс хуже Пуассона: самовозбуждение делает поток менее стабильным, риск-менеджмент тяжелее, и те же гиперпараметры, что под Пуассон, сюда могут не подходить.
Таблица 1, RN ($\eta=\zeta=0$), противник All — характерный срез:
- Always Quoting: богатство $3.86\pm 3.73$, Шарп $1.04$, инвентарь $1.40\pm 1.75$.
- 2-action: $3.84\pm 3.57$, Шарп $1.07$, котировки $0+100+0+0$ (всегда обе стороны).
- 4-action train/test 2: $3.87\pm 3.60$, Шарп $1.07$, $0.23+99.77+0+0$.
- 4-action train 2 / test 200: $3.11\pm 2.98$, Шарп $1.05$, $0.63+99.37+0+0$ — Шарп почти тот же.
- 4-action train/test 200: $3.41\pm 3.74$, Шарп $0.91$, $0+78.20+0+21.80$ — больше односторонних, Шарп ниже.
На Fixed в той же таблице 4-action с train/test 200 уже $74\%$ двусторонних и $26\%$ только bid; Шарп $0.61$ против $0.68$ у агента, обученного на низкой воле.
2-action и 4-action при $\sigma=2$. Несмотря на право молчать, агенты котируют обе стороны $\gt 90\%$ времени — в духе правил LSE (котировать $\ge 90\%$ непрерывной сессии) и MiFID II / Deutsche Börse (не менее $50\%$ часов в месячном среднем). Шарп чуть выше Always Quoting. Две причины: ARL-Always-Quoting уже умеет управлять риском через цены, и в симуляторе мало «настоящей» волы на сделку из-за лимита объёма. Плюс Хоукс: после сделки интенсивность резко растёт и медленно спадает — агенту выгоднее оставаться в книге, чтобы поймать кластер.
Перенос на $\sigma=200$. 4-action, обученный при 2 и тестируемый при 200, почти не деградирует относительно train/test 2. 4-action, которого учили при 200 на политиках с волы 2, чаще молчит или встаёт в одну сторону, Шарп заметно ниже. Расхождение авторы списывают на mismatch: adversary и Always Quoting калиброваны под спокойный рынок, а среда теста — нет; агент отвечает осторожностью.
При росте $\eta$ (штраф терминального инвентаря) 4-action train/test 200 ещё консервативнее: в табл. 5 (Fix) доля молчания $45\%$, двусторонних только $47\%$. При $\zeta=0.01$ (бегущий штраф инвентаря) на Fix — $31\%$ двусторонних и $67\%$ только ask. Агент с train 2 / test 200 в тех же таблицах остаётся около $92$–$100\%$ двусторонних.
Рис. 2–7 оригинала: плотности терминального богатства и violin-плоты по типам противника (Fix, Random, A, B, K, All) при RN. Кривые 2-action и 4-action при $\sigma=2$ близки к Always Quoting; train/test 200 — шире и смещены.
6. Заключение
ARL + Хоукс + расширенные действия дают MM, который переносит низковолатильное обучение на высокую волу: 4-action train@2 / test@200 стабилен. Тот же 4-action, обученный при 200 на always-quoting политике с волы 2, проседает — mismatch политик, а не «нельзя котировать в бурю».
Дальше стоит проверить: если при $\sigma=200$ дать агенту always-quoting стратегию, тоже обученную при 200, будет ли он по-прежнему уходить с рынка или начнёт зарабатывать на спреде.
Литература
- Abergel, F. and Jedidi, A. Long-time behavior of a Hawkes process-based LOB. 2015. ↑
- Abernethy, J. and Kale, S. Adaptive market making via online learning. NeurIPS 2013. ↑
- Avellaneda, M. and Stoikov, S. High-frequency trading in a limit order book. 2008. ↑
- Bacry, E. et al. Microstructure noise; slowly decreasing Hawkes kernels; Hawkes in finance; price and trades HF dynamics. 2013–2016.
- Cartea, Á., Jaimungal, S. and Penalva, J. Algorithmic and High-Frequency Trading. CUP, 2015.
- Chan, N. T. and Shelton, C. An electronic market-maker. 2001.
- Fodra, P. and Labadie, M. HF market-making with inventory constraints. 2012.
- Guéant, O.; Guéant, Lehalle, Fernandez-Tapia. Optimal MM; inventory risk. 2013, 2017. ↑
- Haarnoja, T. et al. Soft actor-critic algorithms and applications. 2018. ↑
- Hawkes, A. G. Spectra of some self-exciting point processes. 1971.
- Ho, T. and Stoll, H. R. Optimal dealer pricing. 1981. ↑
- Jerome, J. et al. mbt-gym: RL for model-based LOB trading. ICAIF 2023. ↑
- Large, J. Measuring the resiliency of an electronic LOB. 2007. ↑
- London Stock Exchange. ETF & ETP Market Maker Obligations. 2022.
- Deutsche Börse Cash Market. MiFID II: Regulated Market Maker. 2019.
- Lu, X. and Abergel, F. High-dimensional Hawkes for LOBs. 2017, 2018. ↑
- Roldan Contreras, A. and Swishchuk, A. Optimal liquidation, acquisition and MM under Hawkes LOB. 2022. ↑
- Spooner, T. et al. Market making via RL. 2018. ↑
- Spooner, T. and Savani, R. Robust market making via adversarial RL. 2020. ↑
- Swishchuk, A. and Huffman, A.; Guo, Q. et al. Compound Hawkes in LOBs. 2020. ↑
- Toke, I. M. and Pomponio, F. Modelling trades-through using Hawkes. 2012. ↑
- Wang, Z., Ventre, C. and Polukarov, M. Robust Market Making: To Quote, or not To Quote. ICAIF 2023.
Перевод: полный текст §§1–6, 8 стр. Рис. 2–7 и полные табл. 2–7 — в PDF оригинала. · arXiv:2508.16589 · лицензия arXiv nonexclusive-distrib 1.0