Online Learning of Order Flow and Market Impact with Bayesian Change-Point Detection Methods
Иоанна-Ивонни Цакнаки · Scuola Normale Superiore, Pisa · Фабрицио Лилло · Dipartimento di Matematica, Università di Bologna и Scuola Normale Superiore, Pisa · Пьеро Маццаризи · Università di Siena · arXiv:2307.02375v2, 2 мая 2024
Оригинал: Tsaknaki, I.-Y., Lillo, F., Mazzarisi, P. «Online Learning of Order Flow and Market Impact with Bayesian Change-Point Detection Methods», 2023–2024 — arxiv.org/abs/2307.02375 (PDF, 25 страниц).
Перевод выполнен с указанием источника в ознакомительных целях. Код авторов: ScoreDrivenBOCPD, olofmi.
Аннотация
Финансовый поток заявок (order flow) обладает заметной персистентностью: сделки на покупку (продажу) часто сопровождаются последующими покупками (продажами) на протяжённых интервалах. Эта персистентность связана с разделением и постепенным исполнением крупных заявок (мета-ордеров). В результате могут возникать различные режимы потока, которые удаётся выделить подходящими моделями временных рядов. В статье предлагается использовать байесовские методы онлайн-детекции точек разлада (Bayesian online change-point detection, BOCPD) для идентификации смены режимов в реальном времени и онлайн-прогноза потока заявок и рыночного импакта. Для повышения эффективности разработан новый вариант BOCPD на основе score-driven подхода: он допускает временные корреляции и зависящие от времени параметры внутри каждого режима.
Эмпирическое применение к данным NASDAQ показывает: (i) предложенная модель даёт лучшую out-of-sample прогнозную точность, чем модели, предполагающие i.i.d.-поведение внутри режима; (ii) по остаткам модель хорошо специфицирована и по распределительным предположениям, и по временным корреляциям; (iii) внутри режима динамика цены вогнута по времени и объёму, как у реальных крупных заявок; (iv) учёт информации о режимах улучшает онлайн-прогнозы потока и импакта по сравнению с моделями без режимов.
Ключевые слова: поток заявок; рыночный импакт; байесовская детекция точек разлада; BOCPD; режимы; мета-ордера; score-driven модели; онлайн-обучение; NASDAQ.
1. Введение
Изучение и моделирование потока заявок и рыночного импакта критичны для понимания того, как частная информация встраивается в цены, и для построения торговых алгоритмов с учётом транзакционных издержек. Обширная литература (Bouchaud et al., 2009; Lillo, 2023) показывает, что совместное моделирование импакта и потока сложнее, чем кажется на первый взгляд.
Персистентность и автокорреляция подписанного потока сделок (последовательность подписанных объёмов: положительный — buyer-initiated, отрицательный — seller-initiated) подробно документированы начиная с работ Lillo, Farmer (2004) и Bouchaud et al. (2004). Эта персистентность согласуется с процессом с длинной памятью, поэтому реалистичная модель импакта должна сочетать статистически эффективные цены с коррелированным потоком. Transient impact models (propagator models, Bouchaud et al., 2004) успешно решают эту задачу. Эмпирически временная персистентность потока в основном объясняется order splitting (Tóth et al., 2015): крупные инвесторы исполняют «мета-ордера» последовательно через более мелкие «child orders». Модель Lillo et al. (2005) количественно связывает автокорреляцию потока с распределением размеров мета-ордеров: сильная серийная зависимость возникает из оптимального исполнения институциональных инвесторов.
С эконометрической точки зрения это перекликается с известным фактом (Granger, Hyung, 1999; Mikosch, Starica, 1999; Diebold, Inoue, 2001): длинную память можно (приближённо) породить моделями со сменой режимов, где каждый режим имеет короткую память и гетерогенную длину. Такие модели около двадцати лет назад предлагались для объяснения long-range memory волатильности.
Статья предлагает применять модели смены режимов к рядам потока заявок с целями: (i) эконометрически объяснить длинную память потока; (ii) улучшить прогноз потока и динамики цены через обнаруженные режимы; (iii) наметить связь режимов с исполнением мета-ордеров. В отличие от подходов с заранее заданным числом режимов (например, HMM), фокус — на модели с онлайн-детекцией точек разлада (change-points, CP), фиксирующей появление новых режимов. Существующие алгоритмы часто работают офлайн, рекурсивно сегментируя ряд постфактум на всё более мелкие режимы.
Мы сосредоточены на онлайн CP-детекции в байесовском каркасе, удобном для квантификации неопределённости относительно CP через апостериор (Ghahramani, 2015). Основной класс — Bayesian Online Change-Point Detection (BOCPD), предложенный Adams, MacKay (2007) как развитие идей Fearnhead, Liu (2007). С 2007 года BOCPD и расширения применялись в финансах, чаще к доходностям акций (Fan, Mackey, 2017; Lleo et al., 2020; Zhao et al., 2022; Lleo et al., 2022, 2023). Fan, Mackey (2017) расширили BOCPD на мультитсеквенциальную постановку для 401 акции S&P 500. BOCPD использует message-passing для рекурсивного вычисления апостериора времени с последней CP — «run length». При поступлении новых точек этот elapsed time обновляется. Для онлайн-инференса вычисляется underlying predictive model (UPM) — распределение данных при текущей run length (например, гауссовская модель с разными средними по режимам).
В классическом BOCPD данные внутри режима предполагаются i.i.d., что нереалистично для большинства финансовых рядов. Мы расширяем BOCPD на марковские данные внутри режима. Xuan, Murphy (2007) учитывают корреляционную структуру многомерных рядов, но их алгоритм офлайн. Насколько нам известно, это первая работа, сочетающая онлайн-обучение CP с марковской структурой данных. Далее предлагается второе расширение: параметры внутри режима не обязаны быть постоянными — допускается зависящая от времени автокорреляция. Для этого используется класс Score-Driven моделей (Creal et al., 2013; Harvey, 2013) — observation-driven каркас для онлайн-обучения зависящих от времени параметров. Новый метод объединяет онлайн CP-детекцию BOCPD с онлайн-обучением зависящей от времени автокорреляции внутри режима.
Эмпирическое приложение — выборки потока акций NASDAQ. В out-of-sample прогнозировании Score-Driven метод превосходит другие модели, включая автокоррелированные ряды без режимов. Модель корректно специфицирована: остатки внутри режимов некоррелированы. Динамика цены в выявленных режимах вогнута по времени; суммарное изменение цены в режиме вогнуто по объёму — как у реальных мета-ордеров и в духе square-root impact law. Знание режимов потока улучшает прогнозы потока и цены через корреляцию потока с одновременными/будущими изменениями цены (market impact).
Структура: Раздел 2 — данные, целевая переменная и мотивация режимов. Раздел 3 — методология: свойства BOCPD и два предложенных расширения. Раздел 4 — оценка на NASDAQ, свойства режимов, связь с импактом, прогноз. Раздел 5 — импакт внутри режимов. Раздел 6 — онлайн-прогноз потока и импакта. Раздел 7 — заключение.
2. Данные и мотивация
Рассматриваем поток исполненных сделок и, в частности, агрегированный подписанный объём. Пусть $M$ — число сделок за день, $v_i$ ($i=1,\ldots,M$) — подписанный объём $i$-й сделки (положительный для buyer-initiated, отрицательный для seller-initiated), $N$ — число сделок в агрегате. Длина ряда $T=\lfloor M/N\rfloor$. Агрегированный поток на окне $N\cap[N(t-1)+1,\ N(t-1)+N]$:
\[ x_t = \sum_{j=1}^{N} v_{N(t-1)+j},\qquad t=1,\ldots,T. \tag{1} \]Данные: исполненные заявки Microsoft Corp. (MSFT) за март 2020 и Tesla Inc. (TSLA) за декабрь 2021. Для исследования роли масштаба агрегации выбраны $N=240$ и $N=730$ для TSLA и $N=400$ и $N=1200$ для MSFT — в обоих случаях средние интервалы около 1 и 3 минут. Длины рядов: TSLA — 8686 (1 мин) и 2856 (3 мин); MSFT — 8723 (1 мин) и 2908 (3 мин). Выбор 1 и 3 минут произволен, но позволяет избежать микроструктурного шума, оставаясь на высокой частоте.
Согласуясь с литературой (Lillo, Farmer, 2004; Bouchaud et al., 2018), АКФ во всех случаях медленно затухает. Количественно во многих работах показано, что АКФ знаков сделок $\rho(\tau)$ асимптотически ведёт себя как степенной закон
\[ \rho(\tau)\sim\frac{1}{\tau^{\gamma}}, \]где $\gamma<1$, что означает длинную память с показателем Хёрста $H=1-\gamma/2>1/2$.
Происхождение персистентности изучалось эмпирически и теоретически. По размеченным данным LSE Tóth et al. (2015) показали, что long-range persistence сильно обусловлена order splitting (один и тот же трейдер последовательно торгует с одним знаком в рамках оптимального исполнения), тогда как herding играет меньшую роль.
Теоретически связь splitting и длинной памяти потока разъяснена моделью Lillo–Mike–Farmer (LMF, Lillo et al., 2005): участники дробят крупные заявки на child orders. Мета-ордера случайно сэмплируются из распределения размеров $p_L$ ($L\in\mathbb{N}$). Если $p_L$ — степенной закон
\[ p_L = \frac{\alpha}{L^{1+\alpha}}, \tag{2} \]то АКФ знаков асимптотически
\[ \rho(\tau)\sim\frac{1}{\tau^{\alpha-1}}, \tag{3} \]т.е. $\gamma=\alpha-1$. Sato, Kanazawa (2023b) показали, что предсказания LMF остаются верными и при гетерогенности частот торговли и распределений размеров.
Эмпирическая валидация LMF затруднена отсутствием полной информации о мета-ордерах. Lillo et al. (2005) использовали off-market trades как прокси; Vaglica et al. (2008, 2010), Moro et al. (2009) предлагали сегментацию и HMM по брокерским данным; Bershova, Rakhlin (2013), Zarinelli et al. (2015) — частные данные компаний; Sato, Kanazawa (2023a) — account-level данные всей Tokyo Stock Exchange и точно подтвердили связь $\gamma$ и $\alpha$ на уровне рынка и отдельных акций.
Итого: LMF предполагает, что большая часть автокорреляции потока идёт от исполнения мета-ордеров, но из публичных анонимных данных их наличие напрямую не вывести. Старт нового мета-ордера должен приводить к смене режима в ряде потока, детектируемой статистически. Идентификация CP может сигнализировать о прибытии нового исполнения. С рыночной/эконометрической точки зрения CP меняет прогноз будущего потока и цены: для прогноза полезны лишь данные после последней CP. Практически методы должны работать онлайн (в реальном времени, не постфактум, как сегментация у Vaglica et al., 2008) и допускать one-step-ahead прогноз в онлайн-режиме.
3. Байесовские алгоритмы онлайн-детекции точек разлада
Кратко напоминаем BOCPD (Adams, MacKay, 2007) и вводим два расширения: Markovian BOCPD (MBO) и Markovian BOCPD for Correlated data (MBOC). Классический BOCPD предполагает i.i.d. внутри режима. MBO допускает марковскую динамику и серийную корреляцию. И BOCPD, и MBO предполагают постоянные параметры (среднее, дисперсия, автокорреляция) внутри режима. MBOC ослабляет это, допуская зависящую от времени корреляцию через Score-Driven подход (Creal et al., 2013). В companion-работе Tsaknaki et al. (2023) вводится общий класс regime-shift score-driven моделей, где внутри режима могут меняться и другие параметры.
3.1. Алгоритм BOCPD
Пусть $x_{1:T}=\{x_1,\ldots,x_T\}$. Модель предполагает нестационарность из-за режимов и product partition model (PPM, Barry, Hartigan, 1992): данные разбиваются на режимы. Параметры $\theta_R$ внутри режима $R$ — i.i.d. случайные величины из распределения экспоненциального семейства. Здесь — нормальные распределения; гипотеза проверяется статистикой Jarque–Bera в Разделе 4.
Adams, MacKay (2007) предполагают реализацию i.i.d. нормальных СВ с неизвестным средним $\theta_R$ и известной дисперсией $\sigma^2$:
\[ x_i\sim\mathcal{N}(\theta_R,\sigma^2). \tag{4} \]Режимы и разделяющие их CP ненаблюдаемы и выводятся из данных. Цель — инфер времени с последней CP: run length.
Определение 1. Run length $r_t$ — неотрицательная дискретная величина:
\[ r_t = \begin{cases} 0, & \text{если CP в момент } t,\\ r_{t-1}+1, & \text{иначе.} \end{cases} \tag{5} \]Приход CP моделируется процессом Бернулли с hazard rate $1/h$:
\[ p(r_t\mid r_{t-1}) = \begin{cases} 1/h, & r_t=0,\\ 1-1/h, & r_t=r_{t-1}+1,\\ 0, & \text{иначе.} \end{cases} \tag{6} \]Ключевая величина — апостериор run length $p(r_t\mid x_{1:t})$:
\[ p(r_t\mid x_{1:t})=\frac{p(r_t,x_{1:t})}{p(x_{1:t})}. \tag{7} \]Совместное распределение рекурсивно:
\[ p(r_t,x_{1:t})=\sum_{r_{t-1}} p(x_t\mid r_{t-1},x_{1:t-1})\,p(r_t\mid r_{t-1})\,p(r_{t-1},x_{1:t-1}), \tag{8–9} \]где три множителя — UPM, hazard и message. Важно: $r_t$ условно зависит только от $r_{t-1}$. Evidence:
\[ p(x_{1:t})=\sum_{r_t} p(r_t,x_{1:t}). \tag{10} \]UPM — предиктивный апостериор при текущей run length. Из PPM он зависит лишь от последних $r_{t-1}$ наблюдений:
\[ p(x_t\mid r_{t-1},x_{1:t-1})=p\bigl(x_t\mid x_{t-1}^{(r_{t-1})}\bigr), \tag{11} \]где $x_{t-1}^{(r_{t-1})}=x_{t-r_{t-1}:t-1}$ и $x_{t:t-1}=\emptyset$. Благодаря сопряжённости экспоненциального семейства при i.i.d. UPM имеет замкнутую форму. Для нормального закона:
\[ p\bigl(x_t\mid x_{t-1}^{(r_{t-1})}\bigr)=\mathcal{N}\bigl(\mu_{r_{t-1}},\,\sigma^2+\sigma_{r_{t-1}}^2\bigr), \tag{13} \]с апостериорными параметрами
\[ \mu_{r_{t-1}}=\frac{\frac{1}{\sigma^2}\sum_{i=t-r_{t-1}}^{t-1}x_i+\frac{\mu_0}{\sigma_0^2}}{\frac{r_{t-1}}{\sigma^2}+\frac{1}{\sigma_0^2}},\qquad \sigma_{r_{t-1}}^2=\Bigl(\frac{r_{t-1}}{\sigma^2}+\frac{1}{\sigma_0^2}\Bigr)^{-1} \tag{14} \]для $r_{t-1}\in\{1,\ldots,t-1\}$. Run length — латентная переменная; апостериорные параметры зависят от того, куда мы помещаем последнюю CP.
Работа алгоритма. При $t=0$ инициализируются $\mu_0$, $\sigma_0^2$ и известная $\sigma^2$. При $t>0$ приходит $x_t$; UPM (13) считается для всех возможных $\mu_{r_{t-1}}$, $\sigma_{r_{t-1}}^2$ при $r_{t-1}=0,\ldots,t-1$. Затем совместное (9) даёт: (1) growth probabilities $p(r_t=\ell,x_{1:t})$ для $\ell=1,\ldots,t$; (2) вероятность CP $p(r_t=0,x_{1:t})$. После evidence (10) получается апостериор (7). Наконец обновляются $\mu_{r_t}$, $\sigma_{r_t}^2$ для шага $t+1$.
(Другие предположения о распределении длин режимов, ведущие к неэкспоненциальным длинам, оставляются для будущих работ.)
Интуитивно BOCPD на каждом шаге параллельно «ведёт» гипотезы о всех возможных положениях последней точки разлада. Для каждой гипотезы пересчитывается сопряжённый апостериор параметров режима и предиктивное распределение следующей точки. Затем гипотезы перевешиваются: либо режим продолжается (run length растёт), либо объявляется новая CP (run length сбрасывается в ноль). Нормировка через evidence даёт полный апостериор $p(r_t\mid x_{1:t})$, который и используется для онлайн-прогноза и для визуализации наиболее вероятного пути режимов.
3.2. Алгоритм MBO
Независимость данных ограничительна. MBO расширяет BOCPD на марковскую зависимость. Внутри режима $R$ ряд — реализация AR(1) с нормальными инновациями:
\[ \begin{aligned} x_t &\sim \mathcal{N}(\theta_R,\sigma^2), \\ x_t\mid x_{t-1} &\sim \mathcal{N}\bigl(\theta_R+\rho(x_{t-1}-\theta_R),\,\sigma^2(1-\rho^2)\bigr). \end{aligned} \tag{17–18} \]Безусловное распределение нормально с неизвестным $\theta_R$ и известной $\sigma^2$; условное — нормально с постоянной корреляцией $\rho=\mathrm{Cov}(x_t,x_{t-1})/\sigma^2$. Сопряжённость сохраняется: условное распределение члена экспоненциального семейства остаётся в семействе (Wainwright, Jordan, 2008). UPM:
\[ p\bigl(x_{t+1}\mid x_t^{(r_t)}\bigr)=\mathcal{N}\Bigl(\mu_{r_t}+\rho(x_t-\mu_{r_t}),\,\sigma^2(1-\rho^2)+\sigma_{r_t}^2(1-\rho)^2\Bigr), \tag{19} \]где
\[ \mu_{r_t}=\frac{b_{r_t}+\mu_0/\sigma_0^2}{a_{r_t}+1/\sigma_0^2},\qquad \sigma_{r_t}^2=\bigl(a_{r_t}+1/\sigma_0^2\bigr)^{-1}, \tag{20} \] \[ a_{r_t}=\frac{1}{\sigma^2}+\frac{(r_t-1)(1-\rho)^2}{\sigma^2(1-\rho^2)}, \tag{21} \]Коэффициент $b_{r_t}$ задаётся кусочно:
\[ b_{r_t}=\begin{cases} \dfrac{x_t}{\sigma^2}, & r_t=1,\\[1em] \dfrac{x_{t-1}}{\sigma^2}+\dfrac{(1-\rho)(x_t-\rho x_{t-1})}{\sigma^2(1-\rho^2)}, & r_t=2,\\[1em] \dfrac{x_{t+1-r_t}(1-\rho)^2}{\sigma^2}+\dfrac{\displaystyle\sum_{i=t+2-r_t}^{t-1}x_i+(1-\rho)(x_t-\rho x_{t+1-r_t})}{\sigma^2(1-\rho^2)}, & r_t\in\{3,\ldots,t\}. \end{cases} \tag{22} \]При $\rho=0$ формулы сводятся к классическому BOCPD. Экономически ненулевая $\rho$ отражает краткосрочную инерцию знака/объёма внутри режима (например, пока один и тот же мета-ордер продолжает исполняться), тогда как смена режима переключает среднее $\theta_R$ и «обнуляет» полезность более старых наблюдений для прогноза.
3.3. Алгоритм MBOC
Базовая модель и марковское обобщение предполагают постоянные параметры внутри режима. На практике часто есть гетероскедастичность и меняющаяся корреляция. Поскольку интерес — к корреляции потока и временным зависимостям, рассматриваем модель с зависящей от времени $\rho_t$ внутри режима (вариативность и персистентность торгового объёма, связанная с доступной ликвидностью).
Модели с time-varying параметрами обычно сложны в оценке. Следуя Cox (1981), берём observation-driven класс: параметры безусловно случайны, но эволюционируют по нелинейной детерминированной функции прошлых наблюдений. Score-Driven модели (Creal et al., 2013; Harvey, 2013) предполагают авторегрессионную динамику параметра с инновацией, зависящей от score (производной лог-правдоподобия), перемасштабированного обратной матрицей Фишера. Scaled score корректирует параметр в сторону максимизации правдоподобия. Многие стандартные модели (GARCH, ACD, MEM) — частные случаи score-driven.
В MBOC коэффициент $\rho$ становится $\rho_t$ — Score-Driven версией AR(1) (Blasques et al., 2014). Онлайн оцениваются $\rho_t$, среднее режима $\theta_R$ и run length $r_t$. DGP внутри режима:
\[ x_t=\rho_t(x_{t-1}-\theta_R)+\theta_R+u_t,\qquad u_t\sim\mathcal{N}(0,\sigma^2), \tag{23} \] \[ \rho_t=\omega+\alpha s_{t-1}+\beta\rho_{t-1}, \tag{24} \] \[ s_t=I_{t|t-1}^{-d}\cdot\nabla_t,\quad d\in[0,1],\qquad \nabla_t=\frac{\partial\log p_u(u_t)}{\partial\rho_t},\qquad I_{t|t-1}=\mathbb{E}_{t|t-1}[\nabla_t^\top\nabla_t]. \tag{25–27} \]Вектор $\vec\lambda=[\omega,\alpha,\beta,\sigma^2]'$ оценивается MLE. Ниже $d=0$ (без рескейла score):
\[ s_t=\nabla_t=\frac{u_t}{\sigma^2}(x_{t-1}-\theta_R). \tag{28} \](Спецификация не гарантирует $|\rho_t|\le 1$; иногда используют link-функцию. Эмпирически $|\rho_t|>1$ реже чем в одной из тысячи точек — ставим порог $|\rho_t|\le 1$.)
UPM для MBOC:
\[ p\bigl(x_{t+1}\mid x_t^{(r_t)}\bigr)=\mathcal{N}\bigl(\mu_{r_t}+\rho_t(x_t-\mu_{r_t}),\,\sigma^2+\sigma_{r_t}^2\bigr), \tag{29} \]с апостериорными $\mu_{r_t}$, $\sigma_{r_t}^2$ и коэффициентами $a_{r_t}$, $b_{r_t}$, зависящими от $\rho_t$ (ур. (30)–(32)).
На каждом шаге $t>1$ находят $i=\arg\max_{i\in\{1,\ldots,t\}} p(r_t=i\mid x_{1:t})$ и на центрированных данных $x_t-\mu_i$ текущего наиболее вероятного режима оценивают $\vec\lambda$ и фильтруют $\rho_t$. Для робастности и лучшего MSE вводят порог $\eta$: фильтрация корреляции и инференс дисперсии выполняются лишь при $i>\eta$ (в окне не меньше $\eta$ точек). $\eta$ — гиперпараметр, тюнится заранее.
Алгоритм 1 (MBOC), схема. Вход: $\mu_0$, $\sigma_0^2$, $\vec\lambda$, $\rho_1$, $\sigma_i^2$, $p(r_0=0)=1$, $\eta$. Выход: $p(r_t\mid x_{1:t})$, $\hat\mu_t$. На каждом $t$: наблюдать $x_t$; вычислить $\hat\mu_t$; найти $\arg\max_i p(r_t=i\mid x_{1:t})$; если $t>1$ и $i>\eta$ — оценить $\vec\lambda$ GAS по $x_t-\mu_i$ и отфильтровать $\rho_t$; вычислить апостериор (используя $\rho_{t-1}$); обновить $\mu_t$, $\sigma_t^2$.
(Также изучалось обобщение с time-varying дисперсией в духе GARCH; для потока результаты качественно сходны и вынесены в companion-бумагу.)
Практический смысл MBOC для рынка микроструктуры таков: даже внутри одного режима интенсивность и персистентность потока могут меняться — из-за иссякающей ликвидности, ускорения исполнения или конкуренции нескольких мета-ордеров. Score-driven фильтр позволяет адаптировать $\rho_t$ онлайн, не разрывая режим искусственно при каждом локальном изменении корреляции. Порог $\eta$ защищает от нестабильной MLE на слишком коротких окнах: пока наиболее вероятная run length мала, алгоритм опирается на более консервативную спецификацию и избегает переобучения шума.
4. Оценка моделей и эмпирический анализ
Три модели — BOCPD, MBO, MBOC — оцениваются на агрегированном потоке $x_t$ TSLA и MSFT на масштабах 1 и 3 мин. Для обеих акций априор среднего $\mu_0=0$ (симметрия buy/sell). Остальные гиперпараметры тюнятся минимизацией MSE на первом дне каждого месяца. Для TSLA $\sigma_0^2=10^7$ shares$^2$, для MSFT $\sigma_0^2=15\cdot 10^7$. Hazard $h=1/80$. Известная дисперсия: $\sigma^2=10^8$ (TSLA), $15\cdot 10^8$ (MSFT); те же значения — начальная $\sigma_i^2$ в MBOC. Начальная корреляция $\rho_1=0.2$ (TSLA), $0.3$ (MSFT); $\vec\lambda=[0.08,0.02,0.05,10^8]'$; $\eta=20$ (1 мин) и $10$ (3 мин). Для постоянного $\rho$ в MBO тестировались разные значения.
4.1. Сравнение моделей
Онлайн-прогноз потока: сравниваем MSE предиктивного среднего BOCPD, MBO, MBOC с ARMA(1,1), оценённой на всём периоде без режимов — естественный бенчмарк «улучшает ли смена режимов прогноз».
Предиктивное среднее one-step-ahead:
\[ \hat\mu_t=\sum_{r_t} p(x_{t+1}\mid x_{1:t},r_t)\,p(r_t\mid x_{1:t})=\sum_{r_t}\mu_{r_t}\,p(r_t\mid x_{1:t}), \tag{33} \]где $\mu_{r_t}$ из (14), (20) или (30). MSE:
\[ \mathrm{MSE}=\frac{1}{T}\sum_{t=1}^{T}(\hat\mu_{t-1}-x_t)^2. \tag{34} \]| TSLA | MSFT | |||||
|---|---|---|---|---|---|---|
| $\rho$ | 0.1 | 0.2 | 0.3 | 0.2 | 0.3 | 0.4 |
| ARMA | 0.908 | 0.908 | 0.908 | 0.860 | 0.860 | 0.860 |
| BOCPD | 0.907 | 0.907 | 0.907 | 0.878 | 0.878 | 0.878 |
| MBO | 0.895 | 0.896 | 0.911 | 0.835 | 0.834 | 0.844 |
| MBOC | 0.890 | 0.890 | 0.890 | 0.831 | 0.831 | 0.831 |
MBOC превосходит всех конкурентов. MBO и MBOC систематически лучше ARMA(1,1); базовый BOCPD сопоставим с ARMA. Роль гиперпараметра $\rho$ в MBO относительно маргинальна. Итого: режимные модели с марковской корреляцией лучше базового BOCPD и бенчмарка; MBOC — лучшая прогнозная гибкость. Важно, что выигрыш сохраняется на обеих акциях и не сводится к удачному выбору одной константы $\rho$: time-varying корреляция даёт устойчивое снижение MSE. Далее эта гибкость используется для эмпирической связи режимов агрегированного потока с импактом сделок (вероятно включая мета-ордера).
Интерпретация сравнения с ARMA(1,1) существенна методологически. ARMA оценивается на всём периоде и поэтому «видит» всю безусловную автокорреляцию, включая ту, что порождается сменой режимов. Тем не менее онлайн-режимные предикторы, использующие только релевантное окно после последней CP, дают меньшую ошибку. Это согласуется с гипотезой PPM: смешивание данных из разных режимов ухудшает локальный прогноз среднего потока.
4.2. Эмпирический анализ выявленных режимов
Свойства режимов изучаем для MBOC (лучшие результаты).
Определение 2. Пусть $x_{1:T}$ — ряд, $t<s$, и
\[ \arg\max_{i\in\{0,\ldots,t\}} p(r_t=i\mid x_{1:t})=\arg\max_{i\in\{0,\ldots,s\}} p(r_s=i\mid x_{1:s})=0, \tag{35} \]а для любого $u\in(t,s)$ $\arg\max_i p(r_u=i\mid x_{1:u})\ne 0$. Тогда подмножество $x_{t:s-1}$ называется режимом.
Предиктивное СКО:
\[ \hat\sigma_t=\sqrt{\sum_{r_t}\sigma_{r_t}^2\,p(r_t\mid x_{1:t})}. \tag{36} \]Распределение длин режимов. На 1 (3) мин: 911 (546) режимов для TSLA и 1394 (690) для MSFT. Гистограммы (Рис. 4) согласуются с постоянным hazard: длины примерно экспоненциальны. Средние длины: TSLA — 10 (1 мин) и 5 (3 мин) интервалов $\approx$ 10 и 15 торговых минут; MSFT — 7 и 4 интервала $\approx$ 7 и 12 минут. Диапазоны: TSLA $[1,92]$ / $[1,30]$; MSFT $[1,65]$ / $[1,30]$.
Гауссовость внутри режимов. BOCPD/MBO предполагают гауссовость $x_t$ с постоянными параметрами; в MBOC — условная гауссовость из-за time-varying автокорреляции. JB-тест отвергает безусловную гауссовость всего ряда на 1% для обеих акций и масштабов. Внутри режимов MBOC на 3 мин нулевая гипотеза не отвергается на 5% для 94% (95%) режимов TSLA (MSFT); на 1 мин — для 86% (87%). Это поддерживает выбор MBOC: поток внутри режимов приблизительно гауссов.
Автокорреляция остатков. Безусловный поток сильно автокоррелирован. По LMF корреляция обусловлена режимами (мета-ордерами). Ljung–Box по остаткам внутри режимов: на 3 мин нуль некоррелированности не отвергается для 98% (99%) режимов TSLA (MSFT); на 1 мин — 97% (93%). MBOC захватывает большую часть серийной корреляции. Медленный спад безусловной АКФ (Рис. 1) объясняется в основном сменой режимов и лишь частично марковскими зависимостями внутри режима.
Совместно тесты гауссовости и Ljung–Box служат проверкой спецификации: если бы внутри режимов оставалась сильная серийная зависимость или тяжёлые хвосты, апостериоры run length и предиктивные средние были бы смещены. Высокая доля режимов, где нулевые гипотезы не отвергаются, поддерживает использование нормального UPM и интерпретацию обнаруженных сегментов как статистически однородных эпизодов потока. Остающаяся доля отвержений согласуется с тем, что часть режимов коротка (мало степеней свободы у тестов) или содержит переходные эффекты на границах дня.
5. Ценовой импакт во время режимов потока
Изучаем среднюю динамику цены внутри обнаруженного режима и связь суммарного изменения цены с чистым объёмом за тот же период.
5.1. Цена как функция времени внутри режима
Анализ зеркалит исследования средней динамики цены при исполнении мета-ордера (Bacry et al., 2015; Zarinelli et al., 2015): (i) средняя динамика коррелирует со знаком мета-ордера; (ii) динамика вогнута по времени — цена растёт быстрее в начале buy-мета-ордера и медленнее к концу.
Для каждого режима $R$ с началом $t_R$ и концом $s_R>t_R$ знак потока
\[ \epsilon_R=\mathrm{sign}\Bigl(\sum_{t_R\le t<s_R}x_t\Bigr) \]($+1$/$-1$ при доминировании buyer/seller). Поскольку при мета-ордере ожидается дисбаланс, рассматриваем подмножества режимов с
\[ Z_R:=\frac{\sum_{t_R\le t<s_R}x_t}{\sum_{t_R\le t<s_R}|x_t|}>\Theta,\qquad 0\le\Theta<1. \tag{37} \]При $\Theta=0$ — все режимы MBOC. Числа режимов по $\Theta$ — в Приложении A.1.
Пусть $p_t$ — лог-цена последней сделки в интервале $t$. Среднее изменение лог-цены от начала режима до $t_R+k$ ($0\le k<s_R-t_R$):
\[ I^\Theta(k)=\mathbb{E}_R\bigl[\epsilon_R(p_{t_R+k}-p_{t_R-1})\bigm|t_R+k<s_R,\ Z_R>\Theta\bigr]. \tag{38} \]
Вогнутость не следует из одного лишь ненулевого среднего знака потока; её объясняют Transient Impact Model (Bouchaud et al., 2004) или LLOB (Donier et al., 2015), предсказывающие вогнутый временной профиль при ненулевом среднем потоке.
Фильтрация по $\Theta$ усиливает эффект: чем выше порог относительного дисбаланса $Z_R$, тем ближе выборка к эпизодам с выраженным односторонним потоком — именно тем, которые интуитивно ассоциируются с доминирующим мета-ордером. Рост импакта и вогнутости с $\Theta$ поэтому является косвенным свидетельством в пользу «мета-ордерной» интерпретации режимов, хотя без размеченных данных это остаётся гипотезой. Важно также, что $I^\Theta(k)$ строится с conditioning на то, что момент $t_R+k$ всё ещё принадлежит тому же режиму: измеряется внутрирежимная динамика, а не смесь разных эпизодов.
5.2. Импакт как функция объёма
Связь суммарного изменения цены в режиме с суммарным чистым объёмом. Литература (Torre, 1997; Almgren et al., 2005; Tóth et al., 2011, 2016; Moro et al., 2009; Zarinelli et al., 2015; Bershova, Rakhlin, 2013) показывает сублинейный степенной закон объёма мета-ордера с показателем в $[0.4,0.7]$ — square-root impact law. Естественно проверить ту же связь внутри режимов нашего метода.
Определяя $\Delta p_R=p_{s_R}-p_{t_R}$, рассматриваем регрессию
\[ \epsilon_R\Delta p_R=A\Bigl(\epsilon_R\sum_{t_R\le t<s_R}x_t\Bigr)^\gamma+\mathrm{noise}. \tag{39} \]Импакт шумный: оценка на полном наборе и после удаления выбросов (точки вне $[Q_1-1.5\,\mathrm{IQR},\ Q_3+1.5\,\mathrm{IQR}]$). Таблица 2 — параметры без выбросов; полный набор — Приложение A.2. Показатель $\gamma<1$; без выбросов замечательно близок к $0.5$.
| TSLA | ||||||||
|---|---|---|---|---|---|---|---|---|
| $\Delta t=1$ мин | $\Delta t=3$ мин | |||||||
| $\Theta$ | $A$ | SE($A$) | $\gamma$ | SE($\gamma$) | $A$ | SE($A$) | $\gamma$ | SE($\gamma$) |
| 0 | 0.121 | 0.05 | 0.592 | 0.041 | 0.298 | 0.139 | 0.52 | 0.045 |
| 0.5 | 0.159 | 0.066 | 0.567 | 0.041 | 0.284 | 0.133 | 0.528 | 0.045 |
| 0.9 | 0.172 | 0.084 | 0.552 | 0.049 | 0.387 | 0.179 | 0.504 | 0.044 |
| MSFT | ||||||||
|---|---|---|---|---|---|---|---|---|
| $\Delta t=1$ мин | $\Delta t=3$ мин | |||||||
| $\Theta$ | $A$ | SE($A$) | $\gamma$ | SE($\gamma$) | $A$ | SE($A$) | $\gamma$ | SE($\gamma$) |
| 0 | 0.498 | 0.209 | 0.4 | 0.038 | 0.365 | 0.203 | 0.458 | 0.048 |
| 0.5 | 0.469 | 0.209 | 0.408 | 0.04 | 0.314 | 0.185 | 0.47 | 0.05 |
| 0.9 | 0.334 | 0.144 | 0.444 | 0.038 | 0.332 | 0.199 | 0.47 | 0.051 |
Результаты предварительны и требуют валидации на больших панелях (с рескейлом на дневную волатильность и объём), но обнадеживают и намекают на связь выявленных режимов с исполнением мета-ордеров.
6. Онлайн-прогноз потока заявок и рыночного импакта
Онлайн-детекция режимов ставит вопрос: как использовать эту информацию для прогноза последующего потока и изменений цены. В PPM режимы независимы, поэтому для прогноза полезны лишь данные текущего режима; более старые добавляют шум. Через импакт динамика цены коррелирует с потоком — корректное моделирование потока помогает прогнозировать цену.
Поскольку знак потока режима коррелирует с одновременным изменением цены, знание о старте нового режима позволяет прогнозировать будущий поток и, важнее, будущую динамику цены. Фокус — на режимах MBOC (лучшая one-step точность); качественно сходные результаты дают BOCPD и MBO. Связь цены и агрегированного потока существенно объясняется режимами; выбор конкретной модели смены режимов улучшает краткосрочный прогноз потока. В Приложении B MBOC даёт более высокую предсказуемость, чем другие CP-методы.
Если DGP действительно согласован с PPM, данные прошлых режимов для прогноза бесполезны — лучше опираться на текущий режим и его выученные свойства. Но в начале нового режима параметры неопределённы: разумно подождать несколько наблюдений. Кроме того, много режимов очень короткие (Рис. 4) — прогнозы лучше строить после нескольких интервалов.
Онлайн-прогноз потока
При онлайн-детекции CP измеряем корреляцию
\[ I_\epsilon^{(1)}(k)=\mathbb{E}_R\bigl[\mathrm{sign}(x_{t_R})\cdot\mathrm{sign}(x_{t_R+k})\bigr],\qquad k=1,2,\ldots \tag{40} \]($t_R$ — первое наблюдение нового режима; корреляция может выходить за конец режима; $k=0$ тривиально). Бенчмарк без режимов:
\[ \tilde I_\epsilon^{(1)}(k)=\mathbb{E}\bigl[\mathrm{sign}(x_t)\cdot\mathrm{sign}(x_{t+k})\bigr]. \tag{41} \]$I_\epsilon^{(1)}$ — слабый предиктор: много режимов длины 1, и знак режима плохо измеряется первым интервалом. Лучше подождать $m=1,2,\ldots$ интервалов:
\[ I_\epsilon^{(m)}(k)=\mathbb{E}_R\Biggl[\mathrm{sign}\Biggl(\sum_{t=t_R}^{t_R+m-1}x_t\Biggr)\cdot\mathrm{sign}(x_{t_R+m-1+k})\Biggr], \tag{42} \] \[ \tilde I_\epsilon^{(m)}(k)=\mathbb{E}\Biggl[\mathrm{sign}\Biggl(\sum_{s=t}^{t+m-1}x_s\Biggr)\cdot\mathrm{sign}(x_{t+m-1+k})\Biggr]. \tag{43} \]
Онлайн-прогноз рыночного импакта
Онлайн-импакт:
\[ I_{\Delta p}^{(m)}(k)=\mathbb{E}_R\Biggl[\mathrm{sign}\Biggl(\sum_{t=t_R}^{t_R+m-1}x_t\Biggr)\cdot(p_{t_R+m-1+k}-p_{t_R+m-1})\Biggr], \tag{44} \]с бенчмарком
\[ \tilde I_{\Delta p}^{(m)}(k)=\mathbb{E}\Biggl[\mathrm{sign}\Biggl(\sum_{s=t}^{t+m-1}x_s\Biggr)\cdot(p_{t+m-1+k}-p_{t+m-1})\Biggr]. \tag{45} \]Отличия от (38): знак берётся только по $m$ начальным интервалам (каузально), без conditioning на длину режима — после $m$ наблюдений конец режима неизвестен. При $m=1$ величина $\tilde I_{\Delta p}^{(1)}$ — классическая response function (Bouchaud et al., 2004, 2009).
Это различие критично для практики исполнения и маркетмейкинга. Величина (38) использует знак всего режима $\epsilon_R$ и поэтому некаузальна: её нельзя применять в реальном времени. Онлайн-предикторы (42)–(45) используют только уже наблюдаемый префикс режима длины $m$ и сравниваются с безусловными аналогами, которым доступен тот же объём истории, но без знания о CP. Выигрыш режимных кривых над пунктирными бенчмарками на Рис. 6–7 показывает именно ценность детекции разладки, а не просто удлинения окна усреднения.