HLOB — устойчивость информации и структура в книгах лимитных заявок
Антонио Бриола, Сильвия Бартолуччи, Томазо Асте · Department of Computer Science, University College London; Systemic Risk Centre, LSE · 4 июня 2024 (v3)
Переписка: Antonio Briola, antonio.briola.20@ucl.ac.uk. Код: github.com/FinancialComputingUCL/LOBFrame.
Оригинал: Briola, A., Bartolucci, S., Aste, T. «HLOB – Information Persistence and Structure in Limit Order Books», 2024 — arxiv.org/abs/2405.18938 (PDF), лицензия CC BY-NC-ND 4.0.
Рисунки и крупные таблицы воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY-NC-ND 4.0 (некоммерческое использование, без производных).
Аннотация
Мы вводим новую крупномасштабную модель глубокого обучения для прогноза изменений mid-цены книги лимитных заявок и называем её HLOB. Архитектура (i) использует информацию, закодированную информационно-фильтрующей сетью — Triangulated Maximally Filtered Graph, — чтобы выявить более глубокие и нетривиальные структуры зависимостей между уровнями объёма; и (ii) гарантирует детерминированные проектные решения для управления сложностью системы, опираясь на класс гомологических свёрточных сетей. Мы тестируем модель против девяти современных альтернатив на трёх реальных датасетах стакана, в каждом по 15 акций NASDAQ, и систематически характеризуем сценарии, где HLOB превосходит SoTA. Подход проливает новый свет на пространственное распределение информации в книгах заявок и на её деградацию с ростом горизонта прогноза, сужая разрыв между микроструктурным моделированием и прогнозом на глубоком обучении в высокочастотных рынках.
Ключевые слова: микроструктура рынка; книга лимитных заявок; эконофизика; высокочастотная торговля; глубокое обучение.
1. Введение
Финансовые рынки — сложные среды. Сложность идёт из двух факторов: (i) взаимодействие большого числа агентов с разнородными целями на разных временных масштабах, реализующих стратегии, рассчитанные на асимметричную информацию; (ii) возникновение самоорганизующихся коллективных поведений без центрального контроллера, которые поэтому трудно предвосхитить. Совпадение этих аспектов даёт спорадические и ограниченные во времени неэффективности, делающие торговлю прибыльной. Анализ существующих неэффективностей и прогноз новых опирается на математическое и статистическое моделирование рядов, отражающих поведение рынка. Гранулярность этих рядов сильно зависит от цели анализа; в высокочастотном случае (нас интересует именно он) она может быть событийной, вплоть до наносекунды [31].
Большинство современных бирж хранят обновления на уровне заявок в структурах, известных как книги лимитных заявок (LOB). В каждый момент в данной автоматизированной бирже эти структуры содержат снимок намерений участников купить или продать разные количества (объёмы) актива по данной цене. Такие намерения — «заявки» — бывают рыночными, лимитными и отменами; их поток (входящий или исходящий) обычно обрабатывается компьютеризованными системами с механизмом FIFO для приоритета исполнения [6, 8, 9, 11]. Тайминг доступа к информации книги даёт участникам асимметричные уровни информированности. На самом мелком уровне эксплуатации информации говорят о высокочастотной торговле (HFT): стратегиях, получающих преимущество за счёт скорости и действующих на информации, ещё недоступной другим [28]. HFT использует несовершенства микроструктуры во вред другим трейдерам, запуская динамику «хищник–жертва» [16]. Практика заметна на рынке с 2005 года [20]. Несмотря на критику и регуляторное внимание, показано, что опора HFT на рыночные данные разных уровней, а не на внешнюю информацию, вносит шум и тем самым сохраняет непредсказуемость движений цены акций [5].
Трудность обращения со сложностью HFT-систем и наличие больших объёмов данных стимулировали развитие моделей глубокого обучения для связанных задач моделирования и прогноза. За последние годы появились всё более изощрённые решения, часть из них — в сторону информированных архитектур, аккуратно включающих компоненты LOB в производные признаки. Хотя многие исследования показали потенциал этих подходов, разрыв между теоретическими результатами и практической применимостью остаётся заметным [43]. Недавняя работа Briola et al. [11] подчёркивает, что эффективность методов существенно зависит от уникальных микроструктурных характеристик акций. В частности, микроструктурные свойства акций с более высоким торговым риском («small-tick») навязывают более разреженные структуры книги, сильно подрывая способность глубоких архитектур моделировать скрытую динамику. Напротив, свойства акций с более низким риском («large-tick») навязывают более компактные книги, облегчая обработка информации.
Вклад статьи трояк:
- Мы вводим HLOB — новую крупномасштабную архитектуру глубокого обучения, которая использует класс гомологических свёрточных сетей [10, 58], чтобы наложить структуру зависимостей между уровнями объёма LOB и моделировать более глубокие нетривиальные связи между ними. Код всех экспериментов: LOBFrame.
- Мы показываем, что эксплуатируемость информационного содержания, закодированного пространственной структурой архитектуры, ограничена во времени, а скорость её деградации сильно зависит от микроструктурных свойств акций.
- Мы тестируем модель против девяти SoTA-альтернатив на трёх реальных датасетах LOB по 15 акций NASDAQ. Результаты подчёркивают трудность найти модель, стабильно превосходящую остальные; поэтому мы даём ориентиры выбора модели по желаемой интерпретируемости, горизонту прогноза и доступной инфраструктуре.
Дальше: раздел 2 — обзор работ по динамике LOB, архитектурам прогноза и интуиции информационно-фильтрующих сетей и HCNN; раздел 3 — данные; раздел 4 — устройство HLOB и каркас обучения; раздел 5 — результаты; раздел 6 — сильные и слабые стороны модели и открытые задачи.
2. Связанные работы
Мы даём ссылки, необходимые чтобы (i) понять операционную механику LOB; (ii) познакомиться с моделями микроструктурных альф; (iii) ухватить теоретические основания HLOB. Исследование пересекает микроструктуру, глубокое обучение и науку о сетях. Мы не претендуем на полный обзор: для каждой области выборочно ссылаемся на работы, критически релевантные этой статье.
2.1. Книга лимитных заявок
Большинство современных бирж используют электронные системы записи и матчинга намерений участников. В центре — структура данных LOB, уникальная для каждой бумаги на данной бирже и дающая немедленный доступ к видимому спросу и предложению в реальном времени. Участники одной стороны рынка конкурируют друг с другом и одновременно противостоят противоположной стороне: покупатели хотят дешевле, продавцы — дороже, но сторонам нужны друг друг, чтобы сделки состоялись. Книга обновляется (тики) в нерегулярные моменты. События отражают изменения рынка и ограничены заранее заданными шагами: (i) размер тика $\theta$ для цен; (ii) лот $\psi$ для объёмов. На NASDAQ, источнике данных этой работы (разд. 3), $\theta=0.01$ доллара и $\psi=1$.
Обновления возможны через подачу новых заявок. По направлению — bid (покупка) или ask (продажа); по агрессивности — рыночные или лимитные. Рыночная заявка выражает необходимость купить или продать количество актива по текущей лучшей доступной цене на противоположной стороне; обычно с более высокой комиссией. Лимитная выражает намерение купить или продать по цене выгоднее котируемой на лучшем уровне; она встаёт в очередь на одном из более глубоких уровней, не гарантирует исполнения и обычно дешевле по комиссии. Отмены — третий класс: удаляют активные лимитки и обычно не облагаются комиссией.
Временно LOB устроена как стопка снимков тик за тиком и принимает вид многомерного ряда $L\in\mathbb{R}^{T\times 4L}$, где $T$ — длина истории, $L$ — число уровней (размерность $4L$, потому что на каждом уровне регистрируются ask-цена, ask-объём, bid-цена и bid-объём). Пространственно запись книги:
\[ L(\tau)=\bigl\{p_\ell^{\mathrm{ask}}(\tau),\,v_\ell^{\mathrm{ask}}(\tau),\,p_\ell^{\mathrm{bid}}(\tau),\,v_\ell^{\mathrm{bid}}(\tau)\bigr\}_{\ell=1}^{L}. \tag{1} \]Mid-цена $m_\tau$ — среднее лучших ask и bid: $m_\tau=(p_1^{\mathrm{ask}}(\tau)+p_1^{\mathrm{bid}}(\tau))/2$. Спред $\sigma_\tau=p_1^{\mathrm{ask}}(\tau)-p_1^{\mathrm{bid}}(\tau)$.
Уровневое представление (1) удобно для человеческого понимания, но страдает существенным недостатком для автоматического обучения: нет гарантии однородного пространственного разделения между соседними ценовыми уровнями. Когда эта неоднородность усилена микроструктурными свойствами акции (Bouchaud et al. [6]; Briola et al. [11]; Sirignano, Cont [46]), она заметно снижает способность отдельных классов глубоких моделей (например CNN) находить микроальфы [60].
2.2. Глубокое обучение для прогноза LOB
Трудность обращения со сложностью книг и обилие данных стимулировали алгоритмы глубокого обучения. Нас особенно интересуют архитектуры прогноза направления изменения mid-цены на высокочастотном разрешении. Фундаментальные вклады: Sirignano [47], Sirignano и Cont [46], Tsantekidis et al. [51, 52], Passalis et al. [40] — MLP, LSTM [19], CNN [27], Bag-of-Features [39]. Затем эти модули стали ядром более сложных архитектур: Zhang et al. [61] и Tsantekidis et al. [53] сочетают свёртки (пространственная структура) с LSTM (длинные зависимости); Passalis et al. [41] и Tran et al. [50] обогащают BoF вниманием [56]. Tran et al. [48, 49] и Shabani et al. [44, 45] предлагают билинейную проекцию и внимание к ключевой временной и пространственной информации.
По вниманию в прогнозе LOB: Guo и Chen [18] — двустадийное временное внимание; Wallbridge [57], Kisiel и Gorse [23], Zhang et al. [63] — трансформеры. Критическая оценка предшествующих методов: Briola et al. [8, 11], Lucchese et al. [33], Kolm и Westray [24], Kolm et al. [25].
2.3. Информационно-фильтрующие сети и гомологические (свёрточные) сети
Один из главных вкладов статьи — HLOB, крупномасштабная модель прогноза изменения mid-цены. Она ловит сложные зависимости на более глубоких уровнях книги и преодолевает традиционные CNN-LSTM (например DeepLOB [62]), которые улавливают только зависимости между соседними уровнями и недостаточны для сложности системы.
Ключевой теоретический prior — информационно-фильтрующие сети (IFN) [3, 4, 34, 35, 54]. IFN представляют структуры зависимостей между переменными сложных систем средствами науки о сетях, налагая строгие топологические ограничения (дерево, планарный граф) и оптимизируя глобальные свойства (правдоподобие модели) [1]. Исторически три главных примера: MST [59], PMFG [2, 55] и TMFG [36]. Нас интересует последний. TMFG улавливает связи высшего порядка до четырёх переменных на клику, будучи планарным и хордальным, и максимизирует правдоподобие, рекурсивно соединяя ковариаты с наибольшим сходством [7, 36]. Этот класс IFN вдохновил гомологические свёрточные сети (HCNN) [10] — полностью data-centric архитектуру, использующую свёртки, чтобы извлечь пользу из топологических prior TMFG. Построение TMFG, HCNN и HLOB — в разделах 4.1 и 4.2.
3. Данные
Анализируем 15 акций из 6 секторов и 13 отраслей, все на NASDAQ. Датасет предложен Briola et al. [11] и содержит только активы с large- (10–200 млрд) до mega-капитализацией ($\ge 200$ млрд) на трёхлетнем периоде январь 2017 — декабрь 2019. Акции разбиты на три группы по размеру тика (табл. 1). Первая (CHTR, GOOG, GS, IBM, MCD, NVDA) — small-tick: $\langle\sigma\rangle\ge 3\theta$. Вторая (AAPL, ABBV, PM) — medium-tick: $1.5\theta\lesssim\langle\sigma\rangle\lesssim 3\theta$. Третья (BAC, CSCO, KO, ORCL, PFE, VZ) — large-tick: $\langle\sigma\rangle\lesssim 1.5\theta$. Подробное описание эффективности этой классификации — в исходной работе [11].
| Тикер | Название | Сектор | Группа тика | Капитализация 2017 / 2018 / 2019 |
|---|---|---|---|---|
| CHTR | Charter Communications | Телеком | small | 83.94 / 64.21 / 101.85 млрд |
| GOOG | Alphabet | Технологии | small | 729.45 / 723.55 / 921.13 млрд |
| GS | Goldman Sachs | Финансы | small | 96.09 / 61.43 / 79.86 млрд |
| IBM | IBM | Технологии | small | 142.03 / 101.44 / 118.90 млрд |
| MCD | McDonald’s | Потреб. дискр. | small | 137.21 / 136.21 / 147.47 млрд |
| NVDA | NVIDIA | Технологии | small | 117.26 / 81.43 / 144.00 млрд |
| AAPL | Apple | Технологии | medium | 860.88 / 746.07 / 1.287 трлн |
| ABBV | AbbVie | Здравоохранение | medium | 154.39 / 136.33 / 130.94 млрд |
| PM | Philip Morris | Здравоохранение | medium | 164.09 / 103.78 / 132.39 млрд |
| BAC | Bank of America | Финансы | large | 307.91 / 238.25 / 311.20 млрд |
| CSCO | Cisco | Телеком | large | 189.34 / 194.81 / 203.45 млрд |
| KO | Coca-Cola | Потреб. staples | large | 195.47 / 202.08 / 236.89 млрд |
| ORCL | Oracle | Технологии | large | 195.72 / 162.03 / 169.94 млрд |
| PFE | Pfizer | Здравоохранение | large | 215.89 / 249.54 / 216.82 млрд |
| VZ | Verizon | Телеком | large | 215.92 / 232.30 / 253.93 млрд |
Таблица 1. Обзор акций. Сектор и отрасль — по таксономии NASDAQ [37]; капитализация — companiesmarketcap.com [14].
Для каждой акции — высокоразрешающие tick-by-tick данные LOBSTER [31]. На каждый торговый день книга с $L=10$ уровнями цены и объёма на обеих сторонах (уравнение 1). Как в табл. 2, на каждый год: 40 дней обучения, 5 валидации, 10 последовательных дней теста. Большинство обучающих дней последовательны, с немногими исключениями. Пять дней валидации случайно выбраны из того же периода, что и обучение: это даёт большую устойчивость валидации и возможно благодаря 5-дневной feature-wise скользящей z-стандартизации, предотвращающей утечку данных [11]. Сырые данные обрабатываются пайплайном Lucchese et al. [33], уточнённым Briola et al. [11].
| Год | Обучение | Валидация | Тест |
|---|---|---|---|
| 2017 | 13.03–22.05 | 23.03, 05.04, 13.04, 18.04, 02.05 | 23.05–06.06 |
| 2018 | 09.08–18.10 | 15.08, 16.08, 19.09, 26.09, 03.10 | 19.10–01.11 |
| 2019 | 04.06–13.08 | 14.06, 27.06, 08.07, 10.07, 24.07 | 14.08–27.08 |
Таблица 2. Структура датасетов. Выходные и праздники не входят.
Согласованно с [11] изучаем предсказуемость направления изменения mid-цены на трёх горизонтах $H_{\Delta\tau}\in\{10,50,100\}$, когда движение не меньше $\theta$. Разметка:
\[ \begin{cases} (m_{\tau+\Delta\tau}-m_\tau)\le -\theta &\to -1 \to \text{вниз},\\ -\theta<(m_{\tau+\Delta\tau}-m_\tau)<+\theta &\to 0 \to \text{стабильно},\\ (m_{\tau+\Delta\tau}-m_\tau)\ge +\theta &\to 1 \to \text{вверх}. \end{cases} \tag{2} \]Горизонты всегда в обновлениях книги (неравномерных), физическое время не используется. Простая разность mid-цен даёт больший контроль над амплитудой изменения на разных горизонтах и сохраняет стационарность. Многие альтернативы в литературе опираются на лог-доходность со сглаживанием [33, 38, 51, 62]; они академически приемлемы, но ближе к трекингу тренда, чем к немедленным колебаниям, и дают мало контроля над тиковыми изменениями, критичными для HFT-стратегий.
4. Методы
HLOB опирается на два механизма: (i) информационное содержание топологических prior IFN как вход адаптированных HCNN [10], обрабатывающих зависимости между пространственными компонентами книги (уровнями объёма); (ii) LSTM для длинных временных паттернов. Нужны: процедура дистилляции информации для TMFG и модификации исходной HCNN под входы LOB.
4.1. Построение TMFG
Строительный блок HCNN и HLOB — произвольный IFN, кодирующий зависимости высшего порядка. Вслед за Briola et al. [10] берём TMFG [36]. Сначала из книги убираем ценовые уровни, оставляя только объёмы: снимок сжимается с $L(\tau)\in\mathbb{R}^{4L}$ до $L(\tau)\in\mathbb{R}^{2L}$. Это нужно для однородности информации IFN. Уровни объёма дискретны (минимум — лот $\psi$), а малые вариации от соседних обновлений вносят шум. Чтобы смягчить его, объёмы категоризуются в равномерные бины. Число бинов оптимизируется на обучении и валидации и постоянно для акций с разными микроструктурными свойствами; размер бинов считается индивидуально по акции и по всем уровням объёма на каждый обучающий день.
Второй шаг: для каждой акции и каждого дня обучения — попарная взаимная информация (MI) между уровнями объёма, положительные симметричные матрицы сходства $2L\times 2L$. Надёжность MI усиливается бутстрэпом по дням. Итоговая матрица акции — среднее дневных MI на обучении.
Третий шаг: TMFG акций считаются по средним MI как матрицам сходства. Для многомерной системы $L$ цель — оценить плотность $\tilde f(L\mid G^*)$ со структурой представления $G^*$, лучше всего описывающей истинную неизвестную $f(L)$. С информационно-теоретической точки зрения обучение оптимальной сетевой репрезентации $G^*$ — минимизация дивергенции KL [26] между $f(L)$ и $\tilde f(L\mid G)$ и, следовательно, кросс-энтропии $H$ системы:
\[ G^* \Rightarrow \arg\min_G D_{\mathrm{KL}}\bigl(f(L)\,\|\,\tilde f(L\mid G)\bigr) \Rightarrow \arg\min_G \bigl(H(L\mid G)\bigr). \tag{3} \]Член $\mathbb{E}_f(\log f(L))$ не зависит от $G$ и не нужен для поиска оптимальной сети. Второй член зависит от $G$ и должен быть минимизирован: это оценка энтропии системы, кросс-энтропия $H$. Задача решается инкрементально соединением несвязных частей с наибольшей MI — ровно то, что делает алгоритм TMFG (Massara et al. [36]).
4.2. От HCNN к HLOB
Из каждого TMFG выделяем реализации трёх симплициальных семейств: (i) максимальные клики размера 4 (тетраэдры, 3-симплексы); (ii) размера 3 (треугольники); (iii) размера 2 (рёбра). Этих трёх структур высшего порядка достаточно, чтобы уловить все зависимости выбранного IFN. Поскольку число наблюдаемых уровней объёма постоянно по акциям и дням, детерминированно считаются формы: вектор тетраэдров $17\times 4$, треугольников $52\times 3$, рёбер $54\times 2$. Все они — вход HLOB, который, однако, обрабатывает не только пространственную динамику TMFG, но и временную динамику книги. Как и у Zhang et al. [62], вход включает окно истории в 100 обновлений.
Ценовые уровни несут существенную информацию и включаются на этапе построения HLOB: для каждого timestamp истории векторы тетраэдров, треугольников и рёбер flattening, и к каждому уровню объёма вставляется соответствующая цена. Получаются три двумерных входа: $100\times 136$ (тетраэдры), $100\times 312$ (треугольники), $100\times 216$ (рёбра). Каждый подаётся в отдельную голову HLOB.
Для каждой головы первый свёрточный фильтр размера $(1\times 2)$ со stride $(1\times 2)$. Как у Zhang et al. [62], этот слой суммирует информацию цены и объёма $\{p_\ell^s,v_\ell^s\}$ на уровне $\ell$ и стороне $s$. Stride не даёт разделять параметры между географически (но не логически) соседними входами. Число параметров этой операции — 96 на голову. Второй свёрточный слой ловит связи внутри одной реализации каждого симплициального семейства: между узлами 4-клик, 3-клик и 2-клик. Stride $(1\times 4)$ для тетраэдров, $(1\times 3)$ для треугольников, $(1\times 2)$ для рёбер снова не даёт разделять параметры между компонентами одного семейства. Параметры: 12 384 (тетраэдры), 11 360 (треугольники), 10 336 (рёбра). Третий слой ловит связи между компонентами каждого семейства. Размер фильтра $(1\times\Omega)$, где $\Omega$ — мощность исходного набора: $136/8=17$ тетраэдров, $312/6=52$ треугольников, $216/4=54$ рёбер. Этот уровень свёртки эффективен [10] для информации, не обязательно связанной в исходном графе, но способной положительно влиять на характеризацию неизвестной $f(L)$ (уравнение 3). Поскольку связи этого слоя не следуют напрямую из TMFG, на каждую голову применяется dropout 0.35. Параметры: 17 440, 53 280 и 55 328. После трёх слоёв размер карты признаков каждой головы $(100\times 1)$. Выходы конкатенируются и проходят LSTM (16 640 параметров). Выход — линейный слой с числом выходов, равным числу классов; модель возвращает логиты, вероятности считаются отдельно.
Существуют сильные проектные аналогии с DeepLOB [62] — архетипом этой архитектуры; поэтому в разд. 5 систематически сравниваются их прогнозные качества.
4.3. Экспериментальные условия
Тестируем HLOB против шести SoTA моделей прогноза mid-цены: CNN1 [51], CNN2 [53], DLA [18], BinBTabl [49], BinCTabl [49], DeepLOB [62] — работы 2017–2022, систематизированные в обзоре Prata et al. [43]. Также против двух чисто трансформерных архитектур, адаптированных под LOB: Transformer [56] и iTransformer [30]. Дополнительный бенчмарк — LobTransformer, сочетание трансформеров и CNN по мотивам Wallbridge [57], здесь в пересмотренной версии. Как отмечают Briola et al. [11], у большинства этих архитектур нет исходного кода, что сильно бьёт по воспроизводимости. Для первой группы результаты получены кодом Prata et al. [43]; остальные реализованы с нуля. Все модели включены в пайплайн LOBFrame [11]. Сводка — табл. 3.
Где возможно, гиперпараметры наследуются от Prata et al. [43]; оптимальные веса учатся минимизацией категориальной кросс-энтропии мини-батчами размера 32 [62]. Сэмплирование мини-батчей различно. На обучении — случайное и сбалансированное: с каждого торгового дня берётся число примеров наименее представленного класса; если оно $\ge 5000$, сэмплируется по 5000 на каждый из трёх классов (уравнение 2), иначе — по числу наименьшего класса. На валидации и тесте батчи размера 32 последовательны и покрывают все данные. Все модели обучаются максимум 100 эпох; обучение останавливается, если валидационная потеря не падает хотя бы на 0.003 за 15 эпох. Оптимизатор — AdamW [22, 32]. По последним прикладным результатам [12, 21]: learning rate $6\times 10^{-5}$, $\beta_1=0.90$, $\beta_2=0.95$. Выбор значений определяется пайплайном обучения [11].
Код на Python / PyTorch [42]. Эксперименты — на HPC-кластере факультета Computer Science UCL [13]. 15 акций × 3 года × 10 моделей × 3 горизонта = 450 годовых экспериментов, всего 1350 прогонов, суммарно 7192 часа 20 минут 31 секунда GPU. Использовались десять типов GPU: A100 80GB, A100 40GB, GTX 1080 Ti, RTX 2080 Ti, RTX 4090, RTX 6000 Ada, TITAN X, TITAN Xp, Tesla V100 16GB и 32GB.
5. Результаты
Представляем результаты: (i) эффективность моделей разд. 4.3 в прогнозе направления изменения mid-цены; (ii) поведение HLOB, раскрывающее сложные паттерны структурных зависимостей уровней книги. Во всех экспериментах — три класса акций на $H_{\Delta\tau}\in\{10,50,100\}$. Это позволяет связать эффективность с микроструктурными характеристиками.
5.1. Сравнение качества моделей
Три ключевые метрики: F1, коэффициент Мэттьюса (MCC) [17] и вероятность корректно исполнить round-trip сделку $p_T$ [11]. Результаты — в табл. 4, 5 и 6: лучшая модель (зелёное), вторая (синее), худшая (красное). Для каждой акции модель считается превосходящей остальные, если сумма трёх метрик максимальна. Годовые метрики усреднены.
При $H_{\Delta\tau}=10$ HLOB превосходит SoTA в 73.3% случаев. Для small-tick — лучшая в 4 из 6 сценариев (CHTR, GS, IBM, MCD); для GOOG — вторая, для NVDA — третья. Для medium-tick — лучшая во всех трёх (AAPL, ABBV, PM). Для large-tick — лучшая в 4 из 6 (BAC, CSCO, KO, PFE) и вторая в остальных двух (ORCL, VZ). Средний F1 HLOB: 0.42 / 0.41 / 0.48 (small / medium / large). Средний MCC: 0.16 / 0.16 / 0.33. Средний $p_T$: 0.11 / 0.14 / 0.09. Для small- и medium-tick качества близки по всем трём метрикам, кроме iTransformer и LobTransformer (худшие). Для large-tick даже худшие модели, заметно отставая по F1 и MCC, остаются конкурентоспособны по $p_T$. Выигрыш HLOB против DeepLOB: F1 +0.03 / +0.02 / +0.003; MCC +0.04 / +0.02 / +0.02; $p_T$ +0.02 / +0.01 / 0.00 (small / medium / large).
При $H_{\Delta\tau}=50$ HLOB лучше SoTA в 60% случаев (на 10 п.п. меньше, чем на горизонте 10). Для small-tick лучшая только в 1 из 6 (IBM); GS и MCD — вторая; CHTR, GOOG, NVDA — третья. Для medium-tick снова лучшая во всех трёх. Для large-tick лучшая в 5 из 6 (кроме PFE — вторая). Средний F1: 0.36 (−16.7% к горизонту 10) / 0.40 (−2.5%) / 0.58 (+17.2%). MCC: 0.09 / 0.11 / 0.38. $p_T$: 0.07 / 0.10 / 0.14. iTransformer и LobTransformer по-прежнему худшие; для iTransformer это верно и на large-tick. Выигрыш против DeepLOB по F1 растёт: +0.05 / +0.05 / +0.01.
При $H_{\Delta\tau}=100$ HLOB лучше SoTA лишь в 33% случаев. Для small-tick лучшая в 1 из 6 (IBM); CHTR — вторая; остальные — третья. Для medium-tick — третья во всех трёх. Для large-tick лучшая в 4 из 6 (BAC, CSCO, KO, ORCL), вторая на PFE, третья на VZ. Средний F1: 0.32 / ниже на medium / выше на large относительно короткого горизонта. Информационное преимущество пространственной структуры TMFG деградирует быстрее на sparse small- и medium-tick книгах.
Три группы моделей ведут себя согласованно по горизонтам. Первая: BinBTabl, BinCTabl и HLOB — всегда в верхнем правом квадранте: наиболее эффективны в корректном прогнозе round-trip, хотя не особенно экономны по числу сделок. На горизонте 10 HLOB эффективнее двух бенчмарков, но с самой выраженной склонностью к активной торговле; на 50 и 100 эта склонность исчезает, и HLOB слегка уступает BinBTabl/BinCTabl. Вторая группа: iTransformer и LobTransformer — всегда в нижнем левом квадранте, худшая практичность прогнозов. Третья, разнородная: CNN1, CNN2, DLA, Transformer, DeepLOB. DeepLOB и Transformer стабильно остаются в одном квадранте: менее экономны по числу сделок, но точнее по round-trip. CNN1, CNN2 и DLA — пограничное поведение между III и IV.
Успех HLOB опирается на осмысленность структур высшего порядка IFN. Эффективность устойчива по горизонтам: модель держится на уровне BinCTabl/BinBTabl и постоянно обходит прочие альтернативы, в частности DeepLOB — своего структурно-агностического предка. По сравнению с DeepLOB HLOB ловит два микроструктурных аспекта: (i) у книги есть подлежащая пространственная структура, требующая моделирования высшего порядка между уровнями объёма и цены; (ii) возникновение структур зависимостей — функция размера тика, а их устойчивость на разных горизонтах тоже зависит от него. DeepLOB действует только на соседних уровнях и слабее HLOB на всех горизонтах. На горизонте 10 HLOB лучше всех независимо от тика: средняя структура IFN хорошо моделирует краткосрочную динамику mid-цены. На 50 HLOB остаётся эффективной для medium- и large-tick, где риск (спред) и фактическая глубина книги ниже; для small-tick средняя структура TMFG менее устойчива к изменениям книги. На 100 то же верно и для medium-tick. На длинных горизонтах BinBTabl и BinCTabl слегка сильнее: они применяют двойное внимание по пространству и времени (IFN HLOB обрабатывает только пространство) и перевзвешивают признаки. Цена — падение интерпретируемости. Превосходство этих двух моделей исчезает на large-tick акциях, где структура по уровням объёма выше и информационные дрейфы слабее вредят глубоким моделям.
5.2. Пространственное распределение информации в LOB
На рис. 5–7 — средние (за три года) матрицы MI на обучении по 15 акциям. Анализ показывает, на каких уровнях объёма сосредоточена информация книги и как разные пространственные распределения влияют на прогноз. Эти средние матрицы не используются для построения HLOB, но дают интуицию сценарно-зависимой эффективности. Уровни переименованы: $v_\ell^{\mathrm{ask}}\to A_\ell$, $v_\ell^{\mathrm{bid}}\to B_\ell$.
CHTR и GOOG похожи: ненормированная средняя MI 0.35 и 0.26. У CHTR слабая иерархия; лучшие уровни несут наибольшую кумулятивную MI, плавно убывающую вглубь. Наибольшие точечные реализации — между соседними уровнями той же стороны. У GOOG спад круче, с разрывом после $v_4$. GS: средняя MI 0.45, иначе распределена — три кластера уровней $\{1,3\}$, $\{4,7\}$, $\{8,10\}$ без сглаженного перехода; центральные уровни играют всё более центральную роль. IBM: 0.74, высшая среди small-tick, концентрация на $v_{\ell\in\{4,6\}}$, гладкий переход сверху к середине. MCD: 0.58, в основном на верхних 8 уровнях, иерархия ближе к GS, чем к IBM. NVDA уникальна: 0.31, концентрация на глубоких 6 уровнях — верхние несут наименьшую кумулятивную MI.
Эти результаты прямо следуют из Briola et al. [11]: $\Xi^{\mathrm{Bid}}$ и $\Xi^{\mathrm{Ask}}$ измеряют «фактическую глубину» книги (табл. 7). Когда средняя $\Xi\gg 9.0$, как у CHTR и GOOG, расчёт средней MI по уровням страдает от дрейфов: понятие «уровня» становится чисто теоретическим артефактом с краткосрочной практической отдачей. Напротив, осмысленность матриц MI и устойчивость структур высшего порядка на длинных горизонтах растут при $\Xi\simeq 9.0$; IBM — идеальная среда для пространственно-информированных глубоких моделей.
AAPL: ненормированная средняя MI 0.41, в основном на $v_{\ell\in\{2,10\}}$; лучшие уровни заметно отделены, остальные сильно взаимозависимы. ABBV и PM: 0.59 и 0.63, распределение как у MCD — большая часть MI на верхних 7 уровнях и спад на оставшихся трёх. У AAPL более низкая средняя MI компенсируется большей стабильностью книги (табл. 7), что повышает устойчивость структуры, извлечённой IFN. ABBV и PM имеют $\Xi$, ближе к small-tick, и подвержены тем же неблагоприятным последствиям.
BAC: ненормированная средняя MI 1.18, явная иерархия: $v_1$ — наименьшая попарная MI; $v_{\ell\in\{2,3\}}$ — промежуточная; $v_{\ell\in\{4,10\}}$ — наибольшая концентрация. Внутри групп — гладкий спад вглубь. Large-tick акции в целом сохраняют существенно более высокий уровень структуры; $\Xi$ около 9.0 (табл. 7) почти у всех. Это объясняет устойчивую эффективность глубоких моделей на длинных горизонтах.
Итого: (i) small- и medium-tick обычно страдают от недостатка структуры информационного содержания книги, из-за чего прогнозные способности глубоких моделей быстрее деградируют при удалении горизонта; (ii) large-tick имеют более компактную и осмысленную структуру, гарантируя прямое соответствие теоретического «уровня» практическому информационному каналу — с положительным эффектом на качество и на коротких, и на длинных горизонтах.
6. Заключение и дальнейшая работа
Статья вводит HLOB — крупномасштабную архитектуру глубокого обучения для прогноза направления высокочастотных изменений mid-цены. Новизна — в детерминированном моделировании взаимодействий высшего порядка между уровнями объёма (и цены) через класс IFN: TMFG. Расчёт использует попарную взаимную информацию по уровням объёма; структура оставляет только статистически релевантные зависимости, отсекая слабейшие. Информационное содержание возникающих топологических prior (тетраэдры, треугольники, рёбра) подаётся в HCNN и обрабатывается для прогноза направления mid-цены 15 акций трёх классов за 2017–2019. Этот класс сетей естественно моделирует пространственное измерение книги; здесь он модифицирован LSTM для длинных временных зависимостей — переход от простой HCNN к HLOB.
Развитие архитектуры опирается на гипотезу: более структурированный захват пространственных зависимостей книги повысит точность прогноза. Гипотеза проверена против девяти SoTA; эмпирика также подтверждает теоретические догадки о механике LOB. Три главных вывода:
- У книги есть подлежащая пространственная структура, требующая моделирования высшего порядка между уровнями объёма и цены; моделирование только соседних уровней (как в DeepLOB [62]) субоптимально.
- Возникновение структур зависимостей — функция размера тика; разные типы активов порождают разные структуры, и активы с ясной иерархией (large-tick) имеют больше шансов быть корректно спрогнозированными глубокими моделями.
- Устойчивость информационного содержания, уловимого моделированием пространственной структуры, меняется с горизонтом. Когда книга разрежена и подвержена информационным дрейфам (small- и medium-tick), понятие «уровня» становится чисто теоретическим артефактом с ограниченной во времени реализацией. Модель, построенная на средней MI по уровням, тогда также подвержена выбросам (дрейфам) и эффективна лишь на коротких горизонтах, где вероятность дрейфов ниже.
HLOB — шаг к микроструктурно-информированным моделям прогноза направления высокочастотных изменений mid-цены. Общее качество достойно: существенный прогресс в микроструктурном моделировании, инструмент, сочетающий силу глубокого обучения с нюансированным пониманием механики книги. Сравнение с SoTA выявляет ограничения: двойное внимание по пространству и времени даёт, ценой меньшей интерпретируемости, уточнение нелинейных связей во времени и преимущество над HLOB, который в первую очередь обрабатывает пространственную динамику.
Несколько направлений развития: (i) более тонкие способы считать матрицы сходства в ядре архитектуры; (ii) модификация HLOB, включающая временно эволюционирующие IFN, улавливающие меняющуюся сложность книги. Эта работа — начальный шаг к микроструктурно-информированным моделям, способным адаптироваться к сложностям высокочастотных фазовых переходов рынка.
Благодарности
T.A. признаёт финансовую поддержку ESRC (ES/K002309/1), EPSRC (EP/P031730/1) и EC (H2020-ICT-2018-2 825215). Конфликта интересов нет. Фонды не участвовали в дизайне исследования, сборе и интерпретации данных, написании и решении о публикации. A.B. благодарит Kashif Rasul за помощь в кодировании части SoTA-моделей для сравнения.
Литература
- Aste, T. (2022). Topological regularization with information filtering networks. Information Sciences, 608:655–669. ↑
- Aste, T. and Di Matteo, T. (2006). Dynamical networks from correlations. Physica A, 370(1):156–161. ↑
- Aste, T., Di Matteo, T., and Hyde, S. T. (2005). Complex networks on hyperbolic surfaces. Physica A, 346(1–2):20–26. ↑
- Barfuss, W., Massara, G. P., Di Matteo, T., and Aste, T. (2016). Parsimonious modeling with information filtering networks. Physical Review E, 94(6):062306. ↑
- Bouchaud, J.-P., Farmer, J. D., and Lillo, F. (2009). How markets slowly digest changes in supply and demand. In Handbook of financial markets, pp. 57–160. Elsevier. ↑
- Bouchaud, J.-P., Bonart, J., Donier, J., and Gould, M. (2018). Trades, quotes and prices. Cambridge University Press. ↑
- Briola, A. and Aste, T. (2022). Dependency structures in cryptocurrency market from high to low frequency. Entropy, 24(11):1548. ↑
- Briola, A., Turiel, J., and Aste, T. (2020). Deep learning modeling of limit order book: A comparative perspective. arXiv:2007.07319. ↑
- Briola, A. et al. (2021). Deep reinforcement learning for active high frequency trading. arXiv:2101.07107. ↑
- Briola, A., Wang, Y., Bartolucci, S., and Aste, T. (2023). Homological convolutional neural networks. arXiv:2308.13816. ↑
- Briola, A., Bartolucci, S., and Aste, T. (2024). Deep limit order book forecasting. arXiv:2403.09267. ↑
- Brown, T. et al. (2020). Language models are few-shot learners. NeurIPS, 33:1877–1901. ↑
- UCL CS HPC Cluster. hpc.cs.ucl.ac.uk. ↑
- companiesmarketcap.com. ↑
- Cont, R., Cucuringu, M., and Zhang, C. Cross-impact of order flow imbalance.
- Farmer, J. D. Predator–prey dynamics in markets. ↑
- Chicco, D. and Jurman, G. Matthews correlation coefficient. ↑
- Guo, Z. and Chen, Y. (2022). Dual-stage temporal attention for LOB. DLA. ↑
- Hochreiter, S. and Schmidhuber, J. (1997). Long short-term memory. Neural Computation. ↑
- HFT prominence since 2005. ↑
- Applied findings on AdamW hyperparameters. ↑
- Kingma, D. P. and Ba, J. (2014). Adam. arXiv:1412.6980. ↑
- Kisiel, D. and Gorse, D. Transformer architectures for LOB. ↑
- Kolm, P. and Westray, N. Critical assessment of LOB forecasting. ↑
- Kolm, P. et al. Related LOB forecasting evaluation. ↑
- Kullback, S. and Leibler, R. A. (1951). On information and sufficiency. ↑
- LeCun, Y. et al. Convolutional neural networks. ↑
- HFT and speed advantage. ↑
- Libman, D. et al. Related MI / LOB information analyses.
- Liu, Y. et al. (2023). iTransformer. ↑
- Huang, R. and Polak, T. (2011). LOBSTER. SSRN 1977207. ↑
- Loshchilov, I. and Hutter, F. AdamW. ↑
- Lucchese, L. et al. LOB data processing pipeline. ↑
- Massara, G. P. et al. Information filtering networks. ↑
- Related IFN literature. ↑
- Massara, G. P., Di Matteo, T., and Aste, T. (2016). Network filtering for big data: Triangulated maximally filtered graph. Journal of Complex Networks. ↑
- NASDAQ sector taxonomy. ↑
- Smoothing methods for mid-price labels. ↑
- Passalis, N. et al. Bag-of-Features. ↑
- Passalis, N. et al. (2017). CNN for LOB. ↑
- Passalis, N. et al. Attention-augmented BoF. ↑
- Paszke, A. et al. (2019). PyTorch. NeurIPS. ↑
- Prata, M. et al. (2024). LOB-based deep learning models for stock price trend prediction: a benchmark study. Artificial Intelligence Review, 57(5):116. ↑
- Shabani, M. et al. Bilinear projection and attention for LOB. ↑
- Related bilinear / attention LOB models. ↑
- Sirignano, J. and Cont, R. Universal features of price formation. ↑
- Sirignano, J. (2019). Deep learning for limit order books. Quantitative Finance. ↑
- Tran, D. T. et al. Temporal attention bilinear networks. ↑
- Tran, D. T. et al. (2021). BinBTabl / BinCTabl. ↑
- Tran, D. T. et al. Attention BoF for LOB. ↑
- Tsantekidis, A. et al. (2017). CNN1. Forecasting stock prices from LOB using convolutional neural networks. ↑
- Tsantekidis, A. et al. Related CNN LOB work. ↑
- Tsantekidis, A. et al. (2020). CNN2. Using deep learning for price prediction from LOB. ↑
- TMFG / IFN applications. ↑
- PMFG literature. ↑
- Vaswani, A. et al. (2017). Attention Is All You Need. ↑
- Wallbridge, J. Transformers for limit order books. ↑
- Homological neural networks (archetype of HCNN). ↑
- MST literature (Mantegna). ↑
- Wu, Y. et al. Actual LOB depth $\Xi$. ↑
- Zhang, Z. et al. Convolutional-LSTM LOB models. ↑
- Zhang, Z., Zohren, S., and Roberts, S. (2019). DeepLOB: Deep convolutional neural networks for limit order books. IEEE Trans. Signal Processing, 67(11):3001–3012. ↑
- Zhang, Z. et al. Transformer-based LOB forecasting. ↑
Перевод выполнен с сохранением структуры, формул и данных оригинала. Оригинал: arXiv:2405.18938 · Briola, Bartolucci, Aste · CC BY-NC-ND 4.0.