Моделирование крипторынков мультиагентным обучением с подкреплением
Йоханн Люссанж, Стефано Врицци, Стефано Пальминтери, Борис Гуткин · Laboratoire des Neurosciences Cognitives, INSERM U960, École Normale Supérieure, Париж; Пальминтери и Гуткин также Center for Cognition and Decision Making, НИУ ВШЭ · 16 февраля 2024
Оригинал: Lussange, J., Vrizzi, S., Palminteri, S. and Gutkin, B. «Modelling crypto markets by multi-agent reinforcement learning», 2024 — arxiv.org/abs/2402.10803 (PDF). Код: github.com/johannlussange/symba_crypto.
Рисунки воспроизведены из оригинальной публикации. Оригинал распространяется по лицензии CC BY 4.0; перевод выполнен на её условиях, изменение по отношению к оригиналу — перевод на русский язык. Рисунки приведены из оригинальной публикации.
Ключевые слова: мультиагентное обучение с подкреплением; агентное моделирование; криптовалюты; микроструктура; двойной аукцион; стилизованные факты.
Аннотация
На базе предыдущей работы [1] авторы строят мультиагентную RL-модель (MARL) крипторынка и калибруют её на дневных ценах закрытия Binance по $153$ криптоактивам, непрерывно торговавшимся в 2018–2022. В отличие от ABM/MAS с агентами нулевого интеллекта или одним автономным агентом, здесь каждый участник учится RL. Снизу вверх воспроизводятся и индивидуальное, и коллективное поведение — в том числе на волатильном COVID-периоде. Оценка актива идёт из двух источников: рыночные цены и приближение фундаментальной стоимости сверх того, что видно в цене. Калибровка MAS по реальным данным эмулирует микроструктуру крипторынка и позволяет зондировать режимы медвежьего и бычьего рынка того периода.
1. Введение
Задача. Крипторынки крайне волатильны и плохо предсказуемы [2]: на них действуют и внутренние, и внешние факторы [3]. Utility-токены дают доступ к сервису (например, членство в сети dApp) [4]; криптовалюты и стейблкоины — средство платежа, хранения стоимости или единица счёта [5, 6]; security-токены — доля в реальном активе (акции, облигации, искусство, недвижимость) [7]. Разные децентрализованные технологии [8] и токеномика [9, 10] по-разному бьют по оценке. От идей распределённого реестра [11, 12] современные активы ушли к множеству протоколов [13, 14]: микроструктура уже не та, что у акций со своим стаканом. Фундаментальная оценка [15, 16] тоже другая: у акций это отчётность и сделки компании, у крипты — white paper, регулирование, применимость в расчётах, ограниченная эмиссия (потолок Bitcoin), устойчивость протокола, база пользователей [17, 18].
Прошлая литература. Классические финансовые теории на крипте рискуют отстать [3, 18]. Агентное моделирование [19] смотрит связанность рынков [20], регулирование [21], спрос–предложение [22], HFT [23, 24], QE [25], внешние шоки [26] и хорошо ловит стилизованные факты — статистические закономерности доходностей и волатильности, которые называют универсальными [27]. Классика 1990-х: Kim и Markowitz [28], Levy–Levy–Solomon [29–35], Cont и Bouchaud [36], Solomon и Weisbuch [37], Lux и Marchesi [38, 39], Donangelo и Sneppen [40–43], Solomon, Levy и Huang [44]. Причины движения цены на разных рынках разные, а факты общие — отсюда ценность для архитектуры ABM. Двадцать лет их воспроизведение — отдельная отрасль [45, 27]. Три пересекающихся класса:
- Негауссовы доходности. Распределение уходит от нормального, броуновская цена не работает [46, 47]. Тяжёлые хвосты со степенным показателем обычно в $[2,4]$, отрицательная асимметрия, платикуртоз, мультифрактальные $k$-моменты (показатель не линеен по $k$) [48–54].
- Кластеризация волатильности. Высокая (низкая) волатильность вчера повышает шанс такой же завтра [45, 55–57], независимо от знака следующей доходности: большие колебания идут пачками, длинная память [58], то же у объёмов.
- Затухающие автокорреляции. ACF доходностей почти ноль на всех лагах, кроме самых коротких — mean-reversion микроструктуры даёт отрицательную автокорреляцию [49, 59]. Это согласуется с гипотезой эффективного рынка [60, 61]: по прошлым ценам будущее не предсказать [56, 57]. Нелинейные функции доходностей (квадрат, модуль) коррелируют дольше [59].
Дальше ABM стали реалистичнее и тянут reverse-engineering реальных рядов [62, 63].
Новые тренды. Реализм ABM вырос с ML [64, 65] и мультиагентным обучением [66, 67]. RL [68–70] близок к принятию решений в мозге [71–74] и даёт вычислимый каркас обучения агента при формировании цены. Стыковка RL с реальными финансовыми данными всё ещё открыта [68–70]. Многие модели не эмулируют рынок полностью автономными учениками [68, 75]; интерес к RL-ABM растёт [75–78], в том числе на крипте [79] и на стакане [80–82]. MARL учитывает коллективное поведение [19, 1, 83]. Эта работа продолжает ту линию на данных Binance.
Вклад. С 2009 года список криптовалют превысил $8000$, пик капитализации — $2{,}97$ трлн USD в 2021. К 2023 году больше двухсот бирж; Binance — среди лидеров по дневному обороту. В [1] авторы построили SYMBA (SYstème Multi-agents Boursier Artificiel) — MARL-симулятор акций: RL на прогноз цены и на заявку [19], калибровка на реальном рынке; в [83] смотрели, как агенты эволюционно набирают стратегии. Микроструктура снизу вверх: инвесторы и институты, сделки и портфели. У каждого агента в equity-версии: (i) RL, который растит навык прогноза и торговли; (ii) выученный вес между чартистом и фундаменталистом, зависящий от режима рынка. Заявки идут в центральный стакан, матчятся. По прошлым исходам стратегия подстраивается. SYMBA воспроизводит спрос–предложение, неликвидность и эволюцию спреда [84, 85] и позволяет сравнивать симулированные цены и объёмы с реальностью. Здесь SYMBA калибруют на дневных close Binance по $153$ активам, непрерывно торговавшимся с 27 сентября 2018 по 27 сентября 2022.
Структура. §2 — букварь RL; §3 — архитектура SYMBA, итерация, два RL агента, распределённый стакан двойного аукциона (код на GitHub [86]); §3.5 — калибровка и гиперпараметры; §4 — результаты; §5 — обсуждение и направления дальше.
2. Обучение с подкреплением
Рисунок недоступен для встраивания — смотреть в оригинале
Краткий обзор; подробно — Sutton и Barto [87], Wiering и van Otterlo [88], Szepesvári [89].
Состояния, действия, награды. Множество состояний $s\in\mathcal{S}$ (среда, которую агент не контролирует), действий $a\in\mathcal{A}$, награда $r\in\mathbb{R}$ после выбора действия в состоянии в момент $t$. Сигнал состояния марковский:
\[ \Pr(s_{t+1}=s',r_{t+1}=r'\mid s_t,a_t) =\Pr(s_{t+1}=s',r_{t+1}=r'\mid s_t,a_t,r_t,\ldots,r_1,s_0,a_0). \tag{1} \]Политика и функции ценности. Политика — вероятности действий в состоянии:
\[ \pi(s,a)=\Pr(a\mid s). \tag{2} \]Старт — равновероятный выбор; через исследование сходится к $\pi^*(s,a)$. Награды могут запаздывать: дисконт $\gamma\in(0,1]$, возврат за эпизод длины $T\in\mathbb{N}$:
\[ R_t=\sum_{k=0}^{T}\gamma^{k} r_{t+k+1}. \tag{3} \]При $\gamma\lt 1$ дальние награды весят меньше. Награды стохастичны, поэтому работают ожидания. В model-based версии — функция ценности состояния
\[ V(s)=\mathbb{E}[R_t\mid s_t=s], \tag{4} \]связанная с переходами $P_{ss'}^{a}=\Pr(s_{t+1}=s'\mid s_t=s,a_t=a)$ и ожидаемой наградой $R_{ss'}^{a}=\mathbb{E}(r_{t+1}\mid s_t=s,a_t=a,s_{t+1}=s')$. В model-free — action-value
\[ Q(s,a)=\mathbb{E}[R_t\mid s_t=s,a_t=a]. \tag{5} \]Тройка $\pi$, $V$, $Q$ и есть каркас решения.
Policy-based vs value-based. Policy-based напрямую крутит вероятности пар $(s,a)$ (градиент или без). Value-based сначала оценивает ценность, потом политику. Model-based строит $P_{ss'}^{a}$ и $R_{ss'}^{a}$, затем $V$ или $Q$. Model-free оценивает $V$ или $Q$ без модели среды. GPI (great policy iteration): ценность после возврата уточняет политику, та лучше оценивает ценность — петля до $\pi^*$. Три семьи: динамическое программирование, Монте-Карло, temporal-difference (в тексте опечатка «DP» вместо TD).
Exploration vs exploitation. $\varepsilon$-greedy ($\varepsilon\ll 1$ — почти всегда лучшее действие), softmax с температурой, pursuit. Баланс не закрыт: неизвестно, даст ли ещё исследование лучшую политику.
Temporal credit assignment — как разнести запоздалую награду по цепочке пар $(s,a)$. Проклятие размерности: число пар быстро неперебираемо; состояния и действия надо резать так, чтобы агент успевал их посетить.
Тренды. Policy gradient [90, 91]; Q-learning [92] сужает исследование до пар $(s,a)$; function approximation и deep RL [93]; POMDP [94, 95]; adversarial RL [96]; meta-RL [97]; transfer и imitation; actor-critic [98, 99]; A3C [100]; иерархический RL [101–103]; reward shaping [104]; inverse RL [105]; гомеостатический RL [106, 107]; state-dependent награды [108].
3. Модель и данные
Рисунок недоступен для встраивания — смотреть в оригинале
3.1. Общая архитектура
Параметры: число агентов $I$, число активов $J$, длина симуляции $T$ шагов. Шаг — торговые сутки (крипта торгуется 24/7). Год $T_y=365$, месяц $T_m=30$, неделя $T_w=7$. Статистика — по $S$ прогонам. Издержки: сетевая комиссия $b=0{,}1\%$ на сделку, безрисковая ставка $R=1\%$ годовых, APR (стейкинг и т.п.) $D=3\%$ — для трактуемости одинаковы по активам.
Цикл шага $t$ из четырёх частей.
(i) Инициализация агентов при $t=0$: $I$ агентов (розница или институты) с крипто- и безрисковыми активами; параметры — §3.2.
(ii) Фундамент рынка. Стартовые цены $P^{j}(0)=100$ USD (фиат, не BTC: на микроструктуру цены и объёма это не влияет). Ряды $T^{j}(t)$ — скачкообразные процессы «фундамента» актива. Для крипты фундамент — не квартальный отчёт, а технология и экономический потенциал вне текущей рыночной цены; инвесторы всё равно часто думают «как про акции». Сами $T^{j}(t)$ агентам не видны: агент $i$ оценивает актив $j$ правилом коинтеграции $\kappa^{i,j}[T^{j}(t)]=B^{i,j}(t)$. По $S=20$ симуляциям: среднее число годовых скачков $T^{j}$ выше/ниже $20\%$ равно $1{,}30$; средняя амплитуда скачка $(T^{j}(t)-T^{j}(t-1))/T^{j}(t)$ равна $4{,}97\%$ (ст. откл. $6{,}50$); средняя ошибка $(T^{j}(t)-B^{i,j}(t))/T^{j}(t)$ равна $4{,}69\%$ (ст. откл. $1{,}38$). Ценообразование агента смешивает чартистский и фундаментальный источники.
Рисунок недоступен для встраивания — смотреть в оригинале
(iii) Автономный прогноз и торговля. Два RL на каждого агента и каждый актив (§3.3). $\mathcal{F}^{i}$ строит эконометрический прогноз с учётом микроструктуры и своего $B^{i,j}(t)$. Прогноз кормит $\mathcal{T}^{i}$, который выдаёт лимитку в стакан двойного аукциона [109]. Стакан CEX вроде Binance устроен как фондовый. Фильтр $\mathcal{G}^{i}$ решает, когда отправлять заявку.
(iv) Наполнение и клиринг стакана. На каждом $t$ для каждого $j$ — свой стакан: покупки по убыванию bid, продажи по возрастанию ask, с количеством. Клиринг в том же $t$: матч с лучшего bid и лучшего ask, пока bid не перестанет превосходить ask. Цена $P^{j}(t+1)$ — mid в точке последнего матча; объём $V^{j}(t+1)$ — суммарное количество; спред $W^{j}(t+1)$ — абсолютная разница средних всех bid и всех ask (не классический best bid − best ask). Именно $W^{j}$ входит в ценообразование агентов.
Initialize Market parameters at t=0: I, T, P(t=0)...
Initialize Agents parameters at t=0: w, h, B(t=0)...
for (t=1; t<T; t+=1) {
for (i=0; i<I; i+=1) {
for (j=0; j<J; j+=1) {
Agents[i].F() // RL-прогноз
Agents[i].T() // RL-торговля
}
}
for (j=0; j<J; j+=1) {
OrderBook[j].Sort()
OrderBook[j].Clear() // P(t), V(t)
}
}
Рисунок 4. Псевдокод итерации SYMBA.
3.2. Инициализация
$U(\cdot)$ / $\mathcal{U}$ — непрерывное / дискретное равномерное; $N(\cdot)$ / $\mathcal{N}$ — нормальное. Каждому агенту $i$:
- окно торговли $w^{i}\sim U(T_w,\tau^{i})$ — для фильтра $\mathcal{G}^{i}$;
- безрисковые активы $A^{i}_{\mathrm{bonds}}(0)\sim N(0,10^{4})$;
- количество крипты $Q^{i,j}(0)$ из положительной полунормали $\mathcal{N}^{+}(0,100)$; капитал $A^{i}_{\mathrm{equity}}(0)=\sum_{j}Q^{i,j}(0)P^{j}(0)$. Шорт разрешён. Дробные лоты (0,5 ETH) запрещены — только целые единицы; авторы считают, что на микроструктуру это почти не влияет (на рынке и так ходят mBTC, sat, gwei);
- горизонт инвестиции $\tau^{i}\sim U(T_w,6T_m)$ — от недели до шести месяцев, затем ликвидация;
- память $h^{i}\sim U(T_w,T)$ — длина истории для обучения;
- жест жеста $g^{i}\sim U(0{,}2,0{,}8)$ — готовность торговать выше/ниже своей оценки; масштаб задаёт гиперпараметр $\zeta^{i}$ (табл. 1);
- рефлексивность $\rho^{i}\sim U(0,100\%)$ — вес техники vs фундамента в $\mathcal{F}$;
- скорость обучения $\beta^{i}\sim U(0{,}05,0{,}20)$ на оба RL, из нейронауки [110, 72, 73];
- порог просадки $l^{i}\sim U(40\%,50\%)$ year-to-date peak-to-bottom: ниже — банкротство и выход. Порог выше индустриального, чтобы число агентов не таяло.
$l^{i}$ тюнится гиперпараметром $L$; жест — через $\zeta^{i}$; $\rho^{i}$ выучивается; $\beta^{i}$ из литературы; стартовые портфели, $\tau^{i}$, $w^{i}$, $h^{i}$ заданы.
3.3. Первый RL: прогноз $\mathcal{F}^{i}$
Прямой поиск политики, без $Q$ из GPI [87]. У $\mathcal{F}^{i}$ $729$ пар состояние–действие, у $\mathcal{T}^{i}$ — $972$. $\mathcal{F}^{i}$ смотрит долгую волатильность $s^{F}_{0}$, короткую $s^{F}_{1}$ и зазор фундамент/рынок $s^{F}_{2}$; оптимизирует прогноз на горизонте $\tau^{i}$ тремя действиями: тип эконометрики (mean-reversion / среднее / тренд) $a^{F}_{0}$, длина прошлого окна $a^{F}_{1}$, вес своего фундамента в смеси $a^{F}_{2}$.
Состояния $S^{F}$: $27$ измерений, каждая компонента $0,1,2$. Дисперсии $\sigma_{L}^{2}$ и $\sigma_{S}^{2}$ цены $P^{j}(t)$:
- $\sigma_{L}^{2}$ — долгая волатильность, ряд сортируют и обрезают памятью $h^{i}$. Перцентиль в $t$ даёт $s^{F}_{0}=0$ ниже $25\%$, $s^{F}_{0}=2$ выше $75\%$, иначе $1$;
- $\sigma_{S}^{2}$ так же задаёт $s^{F}_{1}$;
- среднее $|P^{j}(t)-B^{i,j}(t)|/P^{j}(t)$ на $[t-3\tau^{i},t]$: $s^{F}_{2}=0$ если $\lt 10\%$, $=2$ если $\gt 30\%$, иначе $1$.
Действия $A^{F}$: $27$ комбинаций $a^{F}_{0},a^{F}_{1},a^{F}_{2}\in\{0,1,2\}$. Агент считает два средних $\langle P^{j}[t-2T,t-T]\rangle$ и $\langle P^{j}[t-T,t]\rangle$ с $T=(1+a^{F}_{1})\tau^{i}/2$. Эконометрика:
\[ \begin{aligned} a^{F}_{0}=0:&\quad \hat P^{i,j}(t)=P^{j}(t)+\langle P^{j}[t-2T,t-T]\rangle-\langle P^{j}[t-T,t]\rangle,\\ a^{F}_{0}=1:&\quad \hat P^{i,j}(t)=\tfrac12\langle P^{j}[t-2T,t-T]\rangle+\tfrac12\langle P^{j}[t-T,t]\rangle,\\ a^{F}_{0}=2:&\quad \hat P^{i,j}(t)=P^{j}(t)-\langle P^{j}[t-2T,t-T]\rangle+\langle P^{j}[t-T,t]\rangle. \end{aligned} \tag{6–8} \]Это mean-reversion, скользящее среднее и следование тренду. Смесь с фундаментом:
\[ H^{i,j}(t)=\alpha\hat P^{i,j}(t)+(1-\alpha)B^{i,j}(t). \tag{9} \]$\alpha$ из рефлексивности $\rho^{i}$: если $\rho^{i}\le 50\%$, то $\alpha\in\{0,\rho^{i},2\rho^{i}\}$ при $a^{F}_{2}=0,1,2$; если $\rho^{i}\gt 50\%$, то $\alpha\in\{2\rho^{i}-1,\rho^{i},1\}$.
Возврат $R^{F}$. Процент ошибки прогноза, сделанного $\tau^{i}$ шагов назад:
\[ \frac{\lvert H^{i,j}(t-\tau^{i})-P^{j}(t)\rvert}{P^{j}(t)}. \tag{10} \]Ряд сортируют, держат длину $h^{i}$. Перцентиль в $t$ дискретизирует $r^{F}\in\{4,2,1,-1,-2,-4\}$ по корзинам $[0,5)$, $[5,25)$, $[25,50)$, $[50,75)$, $[75,95)$, $[95,100]$ процентов.
Политика $\pi^{F}$. Обновление $\pi^{F}_{t}(s^{F}_{t-\tau^{i}},a^{F}_{t-\tau^{i}})$ со скоростью $\beta$. Чтобы поднять вероятность лучшего действия $a^{F\star}$, $|r^{F}|$ раз:
\[ \begin{aligned} \pi^{F}_{t+1}(s^{F},a^{F\star})&=\pi^{F}_{t}(s^{F},a^{F\star})+\beta\bigl(1-\pi^{F}_{t}(s^{F},a^{F\star})\bigr),\\ \pi^{F}_{t+1}(s^{F},a^{F})&=\pi^{F}_{t}(s^{F},a^{F})-\beta\pi^{F}_{t}(s^{F},a^{F})\quad(a^{F}\ne a^{F\star}). \end{aligned} \tag{11–12} \]Off-policy каждые $\tau^{i}/T_m+2$ шагов: какое действие следовало выбрать $\tau^{i}$ назад при нынешней цене; политика обновляется $\beta$ и $|r^{F}|=4$ раза.
3.4. Второй RL: торговля $\mathcal{T}^{i}$
Состояния: эволюция цены по $\mathcal{F}$ ($s^{T}_{0}$), волатильность ($s^{T}_{1}$), безрисковые активы ($s^{T}_{2}$), крипто-инвентарь ($s^{T}_{3}$), объём сделок ($s^{T}_{4}$). Действия: держать / купить / продать и сколько ($a^{T}_{0}$), цена относительно спроса–предложения ($a^{T}_{1}$).
Состояния $S^{T}$: $108$ измерений; $s^{T}_{0},s^{T}_{1},s^{T}_{4}\in\{0,1,2\}$, $s^{T}_{2},s^{T}_{3}\in\{0,1\}$.
- $\mu=(H^{i,j}(t)-P^{j}(t))/P^{j}(t)$ пишут в ряды $\mu^{-}$ / $\mu^{+}$; перцентили: $s^{T}_{0}=0$ если $\mu^{-}$ ниже $95$-го, $=1$ иначе; по $\mu^{+}$: $=1$ если ниже $5$-го, $=2$ иначе. Итог: прогноз падения / боковика / роста на $\tau^{i}$;
- $\sigma_{L}^{2}$ на $[t-3\tau^{i},t]$: $s^{T}_{1}=0/1/2$ по порогам $33\%$ и $67\%$;
- $s^{T}_{2}=0$, если $A^{i}_{\mathrm{bonds}}(t)\lt 0{,}6\,A^{i}_{\mathrm{bonds}}(0)$, иначе $1$;
- $s^{T}_{3}=0$, если $A^{i}_{\mathrm{equity}}(t)\lt 0{,}6\,A^{i}_{\mathrm{equity}}(0)$, иначе $1$;
- объёмы $V^{j}(t)$: $s^{T}_{4}=0$ при нуле, $=1$ ниже $33$-го перцентиля, иначе $2$.
Действия $A^{T}$: $9$ пар $(a^{T}_{0},a^{T}_{1})\in\{0,1,2\}^{2}$. Стратегия long-only: купить, держать $\tau^{i}$, продать. Bid при $a^{T}_{1}=0,1,2$:
\[ \begin{aligned} P^{i,j}_{\mathrm{bid}}(t)&=\min\bigl[H^{i,j}(t),P^{j}(t)\bigr]+g^{i}W^{j}(t-1),\\ P^{i,j}_{\mathrm{bid}}(t)&=\min\bigl[H^{i,j}(t),P^{j}(t)\bigr],\\ P^{i,j}_{\mathrm{bid}}(t)&=\min\bigl[H^{i,j}(t),P^{j}(t)\bigr]-g^{i}W^{j}(t-1). \end{aligned} \tag{13–15} \]Ask:
\[ \begin{aligned} P^{i,j}_{\mathrm{ask}}(t)&=\max\bigl[H^{i,j}(t),P^{j}(t)\bigr]-g^{i}W^{j}(t-1),\\ P^{i,j}_{\mathrm{ask}}(t)&=\max\bigl[H^{i,j}(t),P^{j}(t)\bigr],\\ P^{i,j}_{\mathrm{ask}}(t)&=\max\bigl[H^{i,j}(t),P^{j}(t)\bigr]+g^{i}W^{j}(t-1). \end{aligned} \tag{16–18} \]$a^{T}_{0}=0$ — продать весь пакет $Q^{i,j}(t)$ по ask; $a^{T}_{0}=1$ — ничего не делать; $a^{T}_{0}=2$ — купить количество $A^{i}_{\mathrm{bonds}}(t)/[P^{i,j}_{\mathrm{ask}}(t)J]$ по bid.
Фильтр $\mathcal{G}^{i}$. Задержка заявки: ряд $\arg\max_{a}Q_{t}(s,a)$, перцентиль $p_{Q}(t)$ сравнивают с $k^{i,j}(t)/w^{i}$ (время с последней сделки / окно). Заявка уходит, только если $p_{Q}(t)\lt k^{i,j}(t)/w^{i}$. На выход по горизонту $\tau^{i}$ фильтр не действует.
Возврат $R^{T}$. Изменение денежного потока относительно мира, где действий $\tau^{i}$ назад не было:
\[ Q^{i,j}_{\mathrm{OB}}(t-\tau^{i})\bigl[P^{j}(t)-P^{i,j}_{\mathrm{OB}}(t-\tau^{i})\bigr]. \tag{19} \]$Q_{\mathrm{OB}}$ и $P_{\mathrm{OB}}$ — фактически склиренные количество и цена (частичное исполнение, mid со встречной заявкой). Перцентиль даёт $r^{T}\in\{4,2,1,-1,-2,-4\}$ по тем же корзинам, что у $\mathcal{F}$.
Политика $\pi^{T}$. После каждой сделки, раз в $\tau^{i}$ шагов, $|r^{T}|$ раз:
\[ \begin{aligned} \pi^{T}_{t+1}(s^{T},a^{T\star})&=\pi^{T}_{t}(s^{T},a^{T\star})+\beta\bigl[1-\pi^{T}_{t}(s^{T},a^{T\star})\bigr],\\ \pi^{T}_{t+1}(s^{T},a^{T})&=\pi^{T}_{t}(s^{T},a^{T})-\beta\pi^{T}_{t}(s^{T},a^{T})\quad(a^{T}\ne a^{T\star}). \end{aligned} \tag{20–21} \]Off-policy каждые $\tau^{i}/T_m+2$ шагов, $|r^{T}|=4$. Дискретные handcrafted пространства — чтобы удержать вычислительную стоимость MAS. Теоретическая опора — фундаментальная теорема ценообразования активов [111]: сегодняшняя цена из дисконтированных ожиданий будущего. Связка прогноз $\mathcal{F}$ + торговля $\mathcal{T}$ родственна моделям вроде [80].
3.5. Калибровка на реальных данных
Допущения. (i) Поведение симулированных агентов отражает реальных инвесторов; (ii) лимитки в стакане отражают динамику реальных криптозаявок. Любая стратегия сводится к buy / sell / hold (long-only). Динамика стаканов документирована [112], в том числе на крипте [113, 114]. Моделировать активность через клиринг заявок многих агентов близко к CEX вроде Binance.
Train / test. Дневные close и объёмы CryptoTick, $153$ активов Binance, 27.09.2018–27.09.2022, OHLCV напрямую с Binance (не консолидация мелких бирж). Только непрерывно торговавшиеся. Гиперпараметры крутили на случайной половине; статистика train vs test стабильна (рис. 5). Три особенности крипты: (i) цена в фиате vs в BTC — разные задачи из-за роли Bitcoin; (ii) торги 24/7; (iii) огромный объём идёт через DEX, не через CEX.
Рисунок недоступен для встраивания — смотреть в оригинале
Гиперпараметры: число агентов $I$, скаляр жеста $\zeta^{i}$, точность коинтеграции $\nu$, порог просадки $L$. До $480$ симуляций по $S=20$ прогонов.
| Гиперпараметр | Low | High | Шаг |
|---|---|---|---|
| Число агентов $I$ | $500$ | $5500$ | $1000$ |
| Скаляр жеста $\zeta^{i}$ | $1{,}0$ | $3{,}0$ | $0{,}5$ |
| Точность коинтеграции $\nu$ | $9$ | $12$ | $1$ |
| Порог просадки $L$ | $10$ | $90$ | $20$ |
Таблица 1. Диапазоны гиперпараметров на обучении.
Чувствительность. Больше $I$ линейно режет краткосрочные флуктуации цены. Больше $\zeta^{i}$ и $\nu$ линейно увеличивают абсолютные дневные доходности. Большие пороги просадки ($L\gt 30\%$) почти не меняют выживаемость агентов.
Сравнение моделей. Gode и Sunder [115]: рынок как замена индивидуальной рациональности. Рис. 6 — кривые обучения топ-$10\%$ агентов SYMBA против топ-$10\%$ шумовых zero-intelligence; также сравнение с современными RL-стаканами [80].
Рисунок недоступен для встраивания — смотреть в оригинале
4. Результаты
Если не сказано иначе: $I=500$, $J=1$, $T=1453$ шага (четыре года), $S=20$. Рис. 7–14 — качественное совпадение формы кривых с реальными данными.
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Итог калибровки: SYMBA воспроизводит распределение лог-доходностей (рис. 7), нормированные волатильности на нескольких шкалах (рис. 8), автокорреляции объёмов (рис. 10) и лог-доходностей (рис. 9, 11–14). Стилизованные факты §1 — негауссовость, кластеры волатильности и объёма, затухающая память — воспроизведены и стыкуются с Binance 2018–2022, включая COVID и пузырь/крах. Важно, чтобы синтетика не давала более эксплуатируемых паттернов, чем реальность.
Дыры: хвосты длинной волатильности (рис. 8) — скачки по разнородным активам (стейблкоины, industrial tokens, монеты) плюс COVID; пик нулевых автокорреляций (рис. 9–12) — нет внутридневки и ещё незрелый no-arbitrage ранней крипты.
5. Обсуждение
MARL-модель SYMBA, калиброванная на Binance 27.09.2018–27.09.2022, ловит ненормальные доходности, кластеризацию объёма и затухание автокорреляций лог-доходностей. Высокая волатильность, децентрализация и спорный фундамент крипты плохо садятся в классические модели; агенты с RL — шаг вперёд, несмотря на ограничения.
Расхождения в хвостах длинной волатильности и лишние нулевые автокорреляции связаны с уникальным режимом 2018–2022 (пузырь, крах, COVID) и с дневной гранулярностью при реальной 24/7-внутридневке. Дальше: внутридневные данные, шоки и политика, нарастающее регулирование. Практический горизонт — риск-менеджмент, регуляторные сценарии, оптимизация инвестиционных стратегий.
Благодарности. ANR CogFinAIgent; Horizon 2020 Marie Skłodowska-Curie No 945304 — Cofund AI4theSciences (PSL University).
Литература
- Lussange, J., Lazarevich, I., Bourgeois-Gironde, S., Palminteri, S. and Gutkin, B., Modelling stock markets by multi-agent reinforcement learning. Computational Economics, 2020. ↑
- Lussange, J., Vrizzi, S., Bourgeois-Gironde, S., Palminteri, S. and Gutkin, B., Stock price formation: precepts from a multi-agent reinforcement learning model. Computational Economics, 2022. ↑
- Lussange, J. et al., Learning and cognition in financial markets: a paradigm shift for agent-based models. SAI Intelligent Systems Conference, 2020. ↑
- SYMBA code: github.com/johannlussange/symba_crypto, 2023. ↑
- Sutton, R. and Barto, A., Reinforcement Learning, 2nd ed. Bradford Books, 2018. ↑
- Wiering, M. and van Otterlo, M., Reinforcement Learning: State-of-the-Art. Springer, 2012. ↑
- Szepesvári, C., Algorithms for Reinforcement Learning. Morgan & Claypool, 2010. ↑
- Watkins, C.J.C.H. and Dayan, P., Q-learning. Machine Learning, 8:279–292, 1992. ↑
- Cont, R. and Bouchaud, J.-P., Herd behavior and aggregate fluctuations in financial markets. Macroeconomic Dynamics, 4:170–196, 2000. ↑
- Lux, T. and Marchesi, M., Scaling and criticality in a stochastic multi-agent model of a financial market. Nature, 397:498–500, 1999. ↑
- Gode, D. and Sunder, S., Allocative efficiency of markets with zero-intelligence traders. Journal of Political Economy, 101, 1993. ↑
- Huang, W., Lehalle, C.-A. and Rosenbaum, M., Simulating and analyzing order book data: the queue-reactive model. JASA, 110:509, 2015. ↑
- Spooner, T., Fearnley, J., Savani, R. and Koukorinis, A., Market making via reinforcement learning. AAMAS, 2018. ↑
- Puljiz, M., Begušić, S. and Kostanjčar, Z., Market microstructure and order book dynamics in cryptocurrency exchanges. Crypto Valley, 2018. ↑
- Silantyev, E., Order flow analysis of cryptocurrency markets. Digital Finance, 1:191–218, 2019. ↑
- Wątorek, M. et al., Multiscale characteristics of the emerging global cryptocurrency market. Physics Reports, 901:1–82, 2021. ↑
- Segnon, M. and Bekiros, S., Forecasting volatility in bitcoin market. Annals of Finance, 16:435–462, 2020. ↑
- Antonakakis, N., Chatziantoniou, I. and Gabauer, D., Cryptocurrency market contagion. J. Int. Financial Markets, 61:37–51, 2019. ↑
- Delbaen, F. and Schachermayer, W., What is a free lunch? Notices of the AMS, 51(5), 2011. ↑
- Palminteri, S. et al., Confirmation bias in human reinforcement learning. PLoS Comput. Biol., 13(8), 2017. ↑
- Keramati, M. and Gutkin, B., Homeostatic reinforcement learning. eLife, 3, 2014. ↑
- Cong, L.W., Li, Y. and Wang, N., Tokenomics: dynamic adoption and valuation. RFS, 34:1105–1155, 2021. ↑
- Nakamoto, S., Bitcoin: a peer-to-peer electronic cash system, 2009.
Оригинал статьи: Lussange et al., «Modelling crypto markets by multi-agent reinforcement learning», arXiv:2402.10803 · лицензия CC BY 4.0