Estimation of an Order Book Dependent Hawkes Process for Large Datasets

7/10

Лука Муччианте, Алессио Санчетта · Department of Economics, Royal Holloway, University of London · 20 июля 2023 (v2: 10 мая 2026)

Переписка: Alessio Sancetta, asancetta@gmail.com.

Оригинал: Mucciante, L., Sancetta, A. «Estimation of an Order Book Dependent Hawkes Process for Large Datasets», 2023 — arxiv.org/abs/2307.09077 (PDF), лицензия CC BY-NC-ND 4.0.

Рисунки и таблицы воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY-NC-ND 4.0 (некоммерческое использование, без производных).

Аннотация

Представлен точечный процесс приходов событий в высокочастотной торговле. Интенсивность — произведение процесса Хоукса и высокоразмерных функций ковариат, извлечённых из стакана. Сформулированы условия стационарности. Дан алгоритм оценки даже при миллиардах точек, с возможным отображением ковариат в высокоразмерное пространство. Такие объёмы типичны для HFT при нескольких ликвидных инструментах. Показана сходимость алгоритма, установлена состоятельность при слабых условиях, предложена тестовая статистика для сравнения спецификаций вне выборки. Применение — четыре акции NYSE. Вневыборочный тест показывает: учёт нелинейности информации стакана добавляет ценность сверх самовозбуждения HFT-событий.

Ключевые слова: считающий процесс; оценка прогноза; высокочастотная торговля; высокоразмерная оценка; one-hot encoding; приход сделок. JEL: C13, C32, C55.

1. Введение

Модель интенсивности приходов событий в HFT зависит от информации стакана. Это процесс Хоукса, в котором интенсивность определяется не только временем с последнего события, но и состоянием книги. Модель рассчитана на высокоразмерные ковариаты. Процедура оценки работает на больших данных через квадратичное программирование. Стакан ликвидного инструмента даёт больше миллиона записей в день; с несколькими инструментами легко выйти на миллионы обновлений.

Оценка интенсивности условно на стакане и сделках опирается на одну реализацию потока, а не на кросс-секцию, как в моделях выживаемости. Случай большого числа обусловливающих переменных изучали Sancetta (2018) и Mucciante & Sancetta (2022), но без самовозбуждения, хорошо задокументированного обзорами Bacry et al. (2015) и Filimonov & Sornette (2015). Высокоразмерная модель Sancetta (2018) учитывает самовозбуждение в симуляциях, но без доказательства стационарности и эргодичности.

Статистика процессов Хоукса с частичной информацией стакана: Fosset et al. (2020), Morariu-Patrichi & Pakkanen (2022), Mounjid et al. (2019), Wu et al. (2019). Эти модели описывают приходы лимитных, рыночных и отмен условно на размере очереди. Они общи, но сложны при росте размерности: состояния обычно конечны и на практике низкоразмерны. Приложения сводятся к одной дискретной переменной стакана. Они не подходят для оценки на большом информационном множестве и не дают теста функциональных ограничений на влияние переменных книги.

Отличия этой работы. Во-первых, ковариаты стакана принимают значения в подмножестве прямой, а не в конечном пространстве состояний. Во-вторых, число ковариат — сотни и тысячи: десять уровней дают десять цен и десять объёмов с каждой стороны; плюс другие инструменты и динамика. В-третьих, параметризация ловит нелинейности отображением в более высокую размерность — удобно для высокоразмерной оценки и тестов ограничений.

Цель — моделирование и состоятельная оценка при сложном нелинейном влиянии стакана и большом информационном множестве. Стакан не моделируется: его переменные — предикторы интенсивности HFT-событий.

Пусть $N:=(N(t))_{t\ge 0}$ — число приходов сделок, адаптированное к фильтрации $\mathcal{F}=(\mathcal{F}_t)_{t\ge 0}$. Момент $j$-го события — $T_j$, $j\ge 1$, $T_0:=0$. Считающий процесс допускает $\mathcal{F}_t$-адаптированную стохастическую интенсивность

\[ \lambda_0(t)=h_0(t)\,g_0(t), \]

где $h_0$ — предсказуемый процесс

\[ h_0(t)=c_0+\int_{(-\infty,t)}\Bigl(\sum_{l=1}^{L}d_{0,l}e^{-a_{0,l}(t-s)}\Bigr)\,dN(s)=c_0+\sum_{j\ge 0:\,T_j\lt t}\sum_{l=1}^{L}d_{0,l}e^{-a_{0,l}(t-T_j)} \]

с $a_{0,l},c_0,d_{0,l}\ge 0$, и

\[ g_0(t)=X(t)'b_0, \]

где $b_0$ — положительный $K\times 1$ вектор, $X:=(X(t))_{t\ge 0}$ — положительный $K\times 1$ левонепрерывный процесс. Положительность $b_0$ и $X$ гарантирует $\lambda_0(t)>0$. Интенсивность: $\lambda_0(t)=\lim_{s\downarrow 0}\Pr(N(t+s)-N(t)>0\mid\mathcal{F}_t)/s$, так что $M(t)=N(t)-\int_{-\infty}^{t}\lambda_0(s)\,ds$ — $\mathcal{F}_t$-мартингал. $K$ может быть порядка тысяч. Для идентификации $d_{0,1}:=1$.

Если $g_0$ постоянна, модель сводится к Хоуксу с ядром — суммой экспонент. Экзогенный приход информации — $c_0$, эндогенная активность — второе слагаемое $h_0$ (Hawkes & Oakes, 1974). Эта интерпретация не учитывает торговую среду. Её несёт стакан и прочие состояния в $g_0$. В приложениях $X$ отображает векторный процесс ковариат $Z$ (информация стакана) в высокоразмерное пространство. Здесь — one-hot encoding, популярный в ML из-за интерпретируемости (Alaya et al., 2019). Другие варианты: ряды Бернштейна, RKHS. One-hot дискретизует переменные в дамми; рост размерности окупается интерпретируемостью и естественными линейными ограничениями (монотонность).

Оценка чередует оценку $h_0$ при фиксированном $g$ и суррогатный лосс для $g_0$ при фиксированном $h$ — в духе coordinate descent (Friedman et al., 2007; Beck & Tetruashvili, 2013). Состоятельность высокоразмерного $b_0$ при $T^{-1}\ln K\to 0$, где $[0,T]$ — интервал выборки.

Эмпирика: Level 3 по четырём акциям и ETF на S&P 500 как вспомогательный инструмент, все на NYSE, LOBSTER. Level 3 позволяет синхронизировать сделки и стакан. Интерес — форма нелинейного влияния дисбаланса объёмов, спреда и информации других инструментов. Неотрицательность $b_0$ даёт «сжатие»: большинство коэффициентов нулевые без явного штрафа (Mucciante & Sancetta, 2022).

1.1. Замечания о литературе

Интенсивности в HFT-эконометрике: Engle & Russell (1998); обзор Bauwens & Hautsch (2009). Дисбаланс объёмов и другие признаки стакана влияют на цену и приходы сделок на коротких горизонтах (Hall & Hautsch, 2007; Cont et al., 2014; Sancetta, 2018). Интервью экс-алготрейдеров Automated Trading Desk (MacKenzie, 2017) подтверждают роль книги.

Sancetta (2018) рассматривал похожую модель, но не масштабируется на миллионы обновлений ковариат. При постоянном $h_0$ Mucciante & Sancetta (2022) дают состоятельную оценку при большом $K$ относительно числа скачков без штрафа, но требуют линейной независимости переменных и не оценивают базовую интенсивность $h_0$.

Оценка $h_0$ при известном $g_0$ эквивалентна оценке Хоукса. Даже низкая размерность здесь коварна (Ogata & Akaike, 1982; Filimonov & Sornette, 2015). Альтернативы правдоподобию: Da Fonseca & Zaatour (2014), Kirchner (2017), Cartea et al. (2021). Эти проблемы здесь не решаются; квадратичная оценивающая функция для $h_0$ давала относительно стабильные оценки.

1.2. План

Раздел 2 — условия регулярности, стационарность и эргодичность (теорема 1). Раздел 3 — алгоритм и симуляции сходимости (плюс screening переменных). Раздел 4 — состоятельность при высокоразмерном $b_0$ и тест сравнения интенсивностей при неограниченной интенсивности. Раздел 5 — четыре ликвидные акции NYSE. Доказательства — в приложении оригинала.

2. Модель

2.1. Условия регулярности

$|\cdot|_1$ — $\ell_1$-норма, $|g_0|_\infty=\sup_{t\ge 0}|g_0(t)|$. Для стационарности нужна слабая экзогенность $X(t)$ условно на $(N_s)_{s<t}$.

Условие 1 (слабая экзогенность). Существует строго положительная $f_0:\mathbb{R}^l\times\mathcal{M}\to\mathbb{R}$, неубывающая и каузальная по второй переменной, такая что $g_0(t)=f_0(W(t),S_t N)$, где латентный $W$ стационарен, эргодичен и независим от $N(t+C)$ для $C\subseteq(-\infty,0)$.

Условие 2 (истинная модель). Интенсивность $N$ не тождественный ноль, как в (1); $X(t)\in[0,1]^K$; $b_0\ge 0$, $|b_0|_1\le B$, причём $B\sum_{l=1}^L d_{0,l}/a_{0,l}<1$ и $d_{0,1}:=1$.

Условие 3 (множество $\mathcal{G}$). $\mathcal{G}=\{g=X'b:|b|_1\le B,\,b_k\ge 0\}$ и $g_0\in\mathcal{G}$.

Условие 4 (множество $\mathcal{H}$). $\mathcal{H}=\{h_\psi:\psi\in\Psi\}$ — семейство ядер (2) с компактными множествами параметров, содержащими истинные $c_0,d_{0,l},a_{0,l}$.

$B$ — свободный параметр; его выбор не критичен (разд. 3.1). Теорема 1: условие $B\sum d_{0,l}/a_{0,l}<1$ плюс слабая экзогенность дают стационарность считающего процесса.

2.2. Замечания

Неотрицательность $b$ при линейно зависимых столбцах $X$ (one-hot, Bernstein, RKHS) смягчает вырожденность: если $b'(\Phi'\Sigma\Phi/T)b\ge\nu b'b$ для всех $b\ge 0$ при некотором $\nu>0$, задача остаётся выпуклой. «Сжатие» без штрафа: многие $b_k$ обнуляются. One-hot плюс неотрицательность естественно кодирует монотонность: если коэффициенты по бинам убывают, влияние монотонно (рис. 2).

2.3. Стационарность и эргодичность

Условие 5. $\lambda_0=h_0 g_0$ — $\mathcal{F}_t$-интенсивность; $g_0$ равномерно ограничена, неотрицательна, удовлетворяет условию 1, и $|g_0|_\infty\sum_l d_{0,l}/a_{0,l}<1$.

При постоянном $g_0$ это обычное условие стационарности Хоукса (Brémaud & Massoulié, 1996).

Теорема 1. При условии 1: (i) существует единственное стационарное распределение $N$ с конечной средней интенсивностью и динамикой (1), процесс эргодичен; (ii) если при $t\le 0$ процесс ограничен множеством $\{N(t)=0:t\le 0\}$, существует стационарный $\tilde N$ с той же динамикой и случайный момент $\tau<\infty$ п.н., после которого $\tilde N(t)=N(t)$. Процессы сцепляются за конечное время независимо от начального условия — важно, потому что данные есть только для $t>0$.

2.4. Приведённая форма для покупок и продаж

Многомерные расширения есть в литературе; здесь оцениваются одномерные интенсивности отдельно. Если

\[ \lambda^{\mathrm{buy}}(t)=h^{\mathrm{buy}}(t)\bigl(g^{\mathrm{buy}}(t)+\rho^{\mathrm{buy}}g^{\mathrm{sell}}(t)\bigr),\qquad \lambda^{\mathrm{sell}}(t)=h^{\mathrm{sell}}(t)\bigl(g^{\mathrm{sell}}(t)+\rho^{\mathrm{sell}}g^{\mathrm{buy}}(t)\bigr) \]

с $\rho\in[0,1)$, система имеет приведённую форму с линейной комбинацией $b^{\mathrm{buy}}$ и $b^{\mathrm{sell}}$. Раздельная оценка buy и sell эквивалентна оценке этой приведённой формы. На больших выборках потеря эффективности вторична. Это отличается от классического многомерного Хоукса, где $\lambda^{\mathrm{buy}}$ зависела бы от $h^{\mathrm{sell}}$ даже условно на $g$.

3. Оценка

Логарифм правдоподобия для $\lambda=hg$:

\[ L_T(h,g)=\int_0^T\ln(hg)\,dN-\int_0^T hg\,d\mu. \]

Позитивность $b$ плюс большое $K$ делают MLE непрактичным. Пусть $X(t)=X(t_j)$ на $(t_j,t_{j+1}]$, $m$ — число обновлений (включая скачки $N$). Второй член правдоподобия требует матрицу $m\times K$ в памяти. При $K$ сотни–тысячи и $m$ миллионы (несколько дней ликвидных инструментов) это нереально. Скачков $N$ за день — тысячи, обновлений стакана — на порядки больше.

В окрестности истины отрицательное правдоподобие квадратично. Альтернатива — МНК для интенсивностей (Gaïffas & Guilloux, 2012). Квадратичный лосс:

\[ Q_T(h,g)=-\frac{2}{T}\int_0^T hg\,dN+\frac{1}{T}\int_0^T(hg)^2\,d\mu. \]

$\mathbb{E}Q_T$ минимизируется при $h=h_0$, $g=g_0$. При известном $h$ это QP. При неизвестном $h$ второй интеграл снова тяжёлый. Поэтому чередуем: при фиксированном $g$ минимизируем $Q_T$ по $h$; при фиксированном $h$ минимизируем суррогат

\[ R_T(g;h)=-\frac{2}{T}\int_0^T\frac{g}{h}\,dN+\frac{1}{T}\int_0^T g^2\,d\mu. \]

Старт: $g$ константа — первая итерация оценивает обычный Хоукс. В координатах

\[ R_T(b)=-\frac{2}{T}b'\Phi'\Gamma+\frac{1}{T}b'\Phi'\Sigma\Phi b, \]

где $j$-я строка $\Phi$ есть $X(t_j)$; $\Gamma_j=1/h(T_l)$, если $t_j$ — скачок $N$, иначе 0; $\Sigma$ диагональна с $(t_j-t_{j-1})$. При новом наблюдении обновляются только $\Phi'\Gamma$ ($K\times 1$) и $\Phi'\Sigma\Phi$ ($K\times K$) — размер не зависит от $m$ и от $h$.

Алгоритм 1. Старт $g^{(0)}=\gamma$. Для $v=1,2,\ldots$: минимизировать $Q_T(h,g^{(v-1)})$ по $h$ → $h^{(v)}$ (при $v=1$ также по $\gamma>0$). Минимизировать $R_T(X'b;h)$ по $b\ge 0$, $\sum b_k\le B$ → $g^{(v)}=X'b^{(v)}$. Стоп, когда $h^{(v)}g^{(v)}$ сходится.

Репараметризация (9). $\lambda_0(t)=\bigl(c_0 d_0+\int\sum d_{0,l}e^{-a_{0,l}(t-s)}\,dN(s)\bigr)\,g_0(t)/\mathbb{E}g_0$. На каждой итерации $\mathbb{E}g$ заменяется текущей оценкой $\frac1m\sum_j X(t_j)'b^{(v-1)}$.

3.1. Выбор $B$

Из-за сжатия неотрицательностью выбор $B$ не критичен. Можно минимизировать $-L_T(\hat h_B,\hat g_B)+K_B$ по $B$, где $K_B$ — число ненулевых коэффициентов. Даже при $B=\infty$ имеем $K_B<K$. Порядок величины: $\mathbb{E}h_0 g_0\approx N(T)/T$ даёт нижнюю границу через параметры обычного Хоукса. В эмпирике: решить (8) при $b=\beta\mathbf{1}_K$, взять $\beta=\mathbf{1}'\Phi'\Gamma/(\mathbf{1}'\Phi'\Sigma\Phi\mathbf{1})$, затем QP с $b_k\in[0,\beta]$, то есть $B=K\beta$. Результаты к альтернативам нечувствительны.

3.2. Симуляции: число итераций

$X(t)$ кусочно постоянно, равномерно на $[0,1]^K$; первые три $b_{0,k}=2/3$, остальные ноль ($\mathbb{E}g=1$); $L=1$, $(c_0,d_0,a_0)=(1,1,2)$; $B=K$. Ошибка (10): число компонент с $|b_k-b_{0,k}|>\alpha\cdot(2/3)$. Одна реализация на 100 000 скачков плюс среднее по 50 симуляциям на 4-й итерации.

Таблица 1. Сходимость алгоритма. Истина: $b_{0,1:3}=2/3$, $(c,d,a)=(1,1,2)$. Avg / s.e. — по 50 симуляциям на итерации 4.
$K$iter$b_1$$b_2$$b_3$$c$$d$$a$Err 0.1Err 0.05Err 0.01
310.6750.6400.6840.7011.1302.171003
2–40.6770.6370.6841.0140.9882.008003
avg0.6680.6670.6650.9980.9992.000001.26
10avg0.6640.6630.6610.9981.0002.001002.30
100avg0.6590.6580.6550.9971.0022.00300.023.42

Двух–трёх итераций достаточно. Есть screening: ненулевые компоненты находятся. Чувствительность к $B$ через множитель $\{0.5,1,10\}$ от рекомендации разд. 3.1 и $B=K$: при Mult. $=0.5$ хуже (недооценка $B$); при Mult. $\ge 1$ и $B=K$ метрики совпадают (табл. 2). False negatives = 0 во всех ячейках; при $K=100$ почти все лишние коэффициенты — false positives, если $B$ слишком мал, но $\ell_1/\ell_2$ ошибки стабильны при разумном $B$.

4. Асимптотика

Теорема 2. $(\tilde h,\tilde g)=\arg\inf Q_T(h,g)$. При условиях регулярности

\[ \frac1T\int_0^T\bigl(h_0 g_0-\tilde h\tilde g\bigr)^2\,d\mu=O_P\Bigl(B\sqrt{\frac{\ln(1+K)}{T}}\Bigr). \]

Теорема 3. Минимизатор $R_T(g;h)$ сходится к лучшей $L^2$-аппроксимации $\lambda_0/h$ равномерно по $h$ в окрестности $h_0$. Вклад размерности $K$ — только логарифмический: метод годится для ультравысокой размерности. В регрессии с гауссовым шумом никакой оценщик выпуклой комбинации не быстрее $(\ln K/n)^{1/4}$ (Tsybakov, 2003); здесь $n\sim N(T)$. Результат оптимален без дополнительных условий.

4.1. Тест двух оценщиков интенсивности

Диагностика $\int_{T_{i-1}}^{T_i}\lambda_0$ как i.i.d. экспоненты не сравнивает две интенсивности. Отношение правдоподобий в высокой размерности имеет нестандартное распределение. Решение — sample splitting: две конкурирующие $\hat\lambda^{(k)}$ оцениваются до момента 0 и оцениваются на следующих днях. Односторонний тест уровня $1-\alpha$: отвергаем модель 2 в пользу 1, если

\[ \frac{L_T^{(1)}-L_T^{(2)}}{\sqrt{T\hat\sigma_T^2}}\ge q_\alpha,\qquad \hat\sigma_T^2=\frac1T\int_0^T\bigl[\ln(\hat\lambda^{(1)}/\hat\lambda^{(2)})\bigr]^2\,dN. \]

Предсказуемая часть отношения правдоподобий $\epsilon_T$ при нуле $o_p(\sqrt{T})$: интенсивности асимптотически дают похожие прогнозы. Теорема 4 обобщает предложение 1 Sancetta (2018) на неограниченные интенсивности: при условиях регулярности статистика сходится к $N(0,1)$.

5. Эмпирическое применение

Моделируем приходы сделок отдельно на каждой стороне. Два типа событий: Any Trade Arrivals — любая сделка на стороне; Large Trade Arrivals — размер не меньше лучшего уровня (adverse selection маркетмейкера: пассивная заявка исполняется, цена уходит против). Четыре акции NYSE: AMZN, CSCO, DIS, KO; вспомогательный SPY. Период 1 марта – 30 апреля 2019, 9:30–16:30, 42 торговых дня.

Вопросы. (1) Даёт ли стакан информацию сверх сделок? (2) Важно ли самовозбуждение после учёта стакана? (3) Нелинейно ли влияние? (4) Достаточно ли простого экспоненциального ядра ($L=1$)?

Данные LOBSTER, первые десять уровней, Level 3. После слияния обновлений с одинаковым timestamp у AMZN > 17 млн снимков и > 400 тыс. сделок. Используем первые три уровня (~60% обновлений). $K\le 177$, порядка 300 млн точек. Оценка: меньше двух часов на разбор данных (по дням) и оценка модели, данные влезают в RAM.

5.1. Сырые ковариаты

Дисбаланс объёма уровня $j$:

\[ \mathrm{VolImb}_j=\frac{\mathrm{BidSize}_j-\mathrm{AskSize}_j}{\mathrm{BidSize}_j+\mathrm{AskSize}_j}\in[-1,1]. \]

Trade imbalance — EWMA знакового объёма, делённая на EWMA беззнакового, $\alpha=0.98$. Длительности в секундах с наносекундами, затем EWMA с $\alpha=0.98$ и $0.90$. Спред в базисных пунктах. Сезонность — время дня в $[09{:}30,16{:}30]$ EST, нормированное в $[0,1]$. Плюс два вспомогательных инструмента без сезонности: 22 сырые ковариаты, после one-hot не более 168 параметров с константой.

Таблица 3. Сырые ковариаты. «Smoothing» — параметр EWMA, если применялся.
ПеременнаяКороткое имяSmoothing
СезонностьSeas
Дисбаланс объёма ур. 1–3VolImb1, VolImb2, VolImb3
СпредSpread
Trade imbalanceTrdImb98$\alpha=0.98$
ДлительностиDur98, Dur90$\alpha=0.98$, $0.90$

Ковариаты сэмплируются только в reference time торгуемого инструмента и лагаются (левонепрерывность), чтобы не было look-ahead: интенсивность в $t_i$ видит стакан только с $t_{i-1}$.

5.2. One-hot encoding

Бины по квантилям обучающей выборки: $[-\infty,q_1)$, $[q_1,q_{10})$, $[q_{10},q_{25})$, $[q_{25},q_{50})$, $[q_{50},q_{75})$, $[q_{75},q_{90})$, $[q_{90},q_{99})$, $[q_{99},\infty)$. Неуникальные квантили (часто у спреда) сливаются. Итого не более 177 параметров, фактически 168.

5.3. Модели

5.4. Результаты

Таблица 4. Размеры выборки. $N$ — события, $m$ — обновления книги с уникальным timestamp. 42 дня.
$N$ Any$N$ Large$m$
AMZN631 370407 13017 130 000
CSCO295 220107 93027 943 000
DIS493 100292 82024 938 000
KO121 21052 84213 956 000

Позитивность и ограничение суммы дают разреженный оценщик. Для H1 доля ненулевых коэффициентов — примерно 20–30% из 168 по четырём акциям, и для Any, и для Large. Согласованность по акциям высокая (табл. 5–6 оригинала): длительности и дисбаланс уровня 1 своего инструмента и SPY входят чаще всего; спред — реже.

Доля ненулевых (Proportion) для Any Trade, модели E / H1 / H2: AMZN 0.24 / 0.27 / 0.27; CSCO 0.24 / 0.27 / 0.27; DIS 0.18 / 0.20 / 0.20; KO 0.28 / 0.31 / 0.30. Для Large Trade чуть ниже у CSCO и KO.

Тест разд. 4.1: последние 5 дней — тест, предыдущие — оценка. Запись E-H1 означает правдоподобие E минус правдоподобие H1. Большое отрицательное значение — второй модель лучше.

  1. H01-H1, H02-H1, H02-H2: большое отрицательное — стакан даёт информацию сверх самовозбуждения;
  2. E-H1: большое отрицательное — самовозбуждение важно даже после учёта стакана;
  3. H1L-H1 и аналоги: большое отрицательное — влияние стакана нелинейно;
  4. H2-H1: большое положительное — простого экспоненциального ядра недостаточно.
Таблица 7. Тест ограничений. Статистика (12), $N(0,1)$ при нуле. Почти всегда «простые» модели отвергаются. Выборка велика, поэтому $|t|$ огромны (мощность теста, разд. 4.1).
Any TradeLarge Trade
AMZNCSCODISKOAMZNCSCODISKO
E-H1Buy−109.88−70.20−93.44−44.41−81.40−22.48−66.48−16.57
Sell−112.77−72.18−86.61−43.36−82.20−26.36−59.26−20.23
H01-H1Buy−20.28−7.84−6.43−12.83−37.01−35.13−14.08−21.27
Sell−15.53−8.32−9.65−39.54−35.27−41.36−21.21−38.94
H02-H1Buy−20.96−3.1039.23−4.11−20.53−33.75−4.24−21.34
Sell−15.28−6.8235.15−24.35−18.58−39.07−12.37−38.00
H2-H1Buy−73.86−44.0263.9227.6541.5111.1320.558.91
Sell−54.8349.3059.8218.5642.2010.3927.047.38
H1L-H1Buy−27.75−13.95−7.61−11.54−27.35−25.92−10.68−23.18
Sell−24.68−15.76−2.95−39.38−26.78−32.51−8.68−41.81
H02-H2Buy−19.02−2.77−1.07−18.27−38.17−34.68−14.76−22.12
Sell−15.09−9.02−5.28−34.93−36.76−40.34−26.29−40.28
H1L-H2Buy−26.70−13.71−40.41−24.05−34.81−26.44−16.76−23.96
Sell−24.57−17.45−38.13−40.26−34.61−33.22−16.58−42.91

Итог: и самовозбуждение, и стакан важны (пункты 1–2). Влияние стакана нелинейно (пункт 3). Ядро обычно сложнее одной экспоненты (пункт 4); знак H2-H1 зависит от акции и стороны — у AMZN Any Trade простая экспонента H1 выигрывает у H2, у DIS/KO и у Large Trade — наоборот.

Коэффициенты one-hot для дисбаланса объёма уровня 1 CSCO
Рис. 1. CSCO, VolImb1, модель H1, Any Trade buy. Коэффициенты $b_k$ по 8 квантильным бинам. Бины > 4 — положительный дисбаланс. Резкий рост в бинах 7–8: только экстремально положительный дисбаланс сильно поднимает интенсивность покупок.
Коэффициенты one-hot для длительности Dur98 CSCO
Рис. 2. CSCO, Dur98, модель H1, Any Trade buy. Бин 1 — длительности ниже 1%-квантиля. Короткие интервалы дают большой коэффициент; дальше коэффициенты быстро падают к нулю — влияние монотонно убывает по длительности даже без явного ограничения монотонности.

6. Заключение

Процесс Хоукса, умноженный на функцию переменных стакана. Условия стационарности и эргодичности сформулированы. Алгоритм оценки работает на очень больших данных, результаты интерпретируемы. Скорость сходимости портится с числом параметров лишь логарифмически. One-hot кодирование покрывается теорией. На четырёх акциях NYSE вневыборочный тест показывает: нелинейность стакана добавляет ценность к самовозбуждению высокочастотных событий.

Литература

  1. Alaya, M. Z. et al. (2019). Binarsity: A penalization for one-hot encoded features. JMLR 20, 1–34.
  2. Bacry, E., Mastromatteo, I. & Muzy, J.-F. (2015). Hawkes processes in finance. Market Microstructure and Liquidity 1(1).
  3. Bauwens, L. & Hautsch, N. (2009). Modelling financial high frequency data using point processes. In Handbook of Financial Time Series, 953–982.
  4. Beck, A. & Tetruashvili, L. (2013). On the convergence of block coordinate descent type methods. SIAM J. Optimization 23, 2037–2060.
  5. Brémaud, P. & Massoulié, L. (1996). Stability of nonlinear Hawkes processes. Ann. Probab. 24, 1563–1588.
  6. Cartea, Á., Cohen, S. N. & Labyad, S. (2021). Gradient-based estimation of linear Hawkes processes. arXiv:2111.10637.
  7. Cont, R., Kukanov, A. & Stoikov, S. (2014). The price impact of order book events. J. Financial Econometrics 12, 47–88.
  8. Da Fonseca, J. & Zaatour, R. (2014). Hawkes process: fast calibration. J. Futures Markets 34, 548–579.
  9. Engle, R. F. & Russell, J. R. (1998). Autoregressive conditional duration. Econometrica 66, 1127–1162.
  10. Filimonov, V. & Sornette, D. (2015). Apparent criticality and calibration issues in the Hawkes model. Quantitative Finance 15, 1293–1314.
  11. Friedman, J. et al. (2007). Pathwise coordinate optimization. Ann. Appl. Stat. 1, 302–332.
  12. Gaïffas, S. & Guilloux, A. (2012). High-dimensional additive hazards models. Related intensity estimation.
  13. Hall, A. R. & Hautsch, N. (2007). Modelling the buy and sell intensity. Related LOB intensity work.
  14. Hawkes, A. G. (1971). Spectra of some self-exciting and mutually exciting point processes. Biometrika 58, 83–90.
  15. Hawkes, A. G. & Oakes, D. (1974). A cluster process representation of a self-exciting process. J. Appl. Probab. 11, 493–503.
  16. Huang, R. & Polak, T. (2011). LOBSTER: Limit order book reconstruction system. SSRN 1977207.
  17. Kirchner, M. (2017). An estimation procedure for the Hawkes process. Quantitative Finance 17, 571–595.
  18. MacKenzie, D. (2017). A material political economy: Automated Trading Desk and the materiality of prices. Interviews with ATD traders.
  19. Morariu-Patrichi, M. & Pakkanen, M. S. (2022). State-dependent Hawkes processes and their application to limit order book data. Quantitative Finance.
  20. Mucciante, L. & Sancetta, A. (2022). High-dimensional intensity estimation complementary to this paper (shrinkage without penalty).
  21. Sancetta, A. (2018). Estimation for high-dimensional Hawkes-type intensities with order book covariates.
  22. Tsybakov, A. B. (2003). Optimal rates of aggregation. In COLT.

Перевод основного текста с сохранением формул, алгоритма и таблиц. Доказательства приложения — в PDF оригинала. Оригинал: arXiv:2307.09077 · Mucciante, Sancetta · CC BY-NC-ND 4.0.