TLOB: трансформер с двойным вниманием для прогноза ценового тренда по данным книги лимитных заявок

8/10

Леонардо Берти, Гьерджи Каснеци · Sapienza University of Rome / Technical University of Munich · 7 мая 2025 (v3)

Оригинал: Berti, L., Kasneci, G. «TLOB: A Novel Transformer Model with Dual Attention for Price Trend Prediction with Limit Order Book Data», 2025 — arxiv.org/abs/2502.15757 (PDF), лицензия CC BY-NC-SA 4.0. Код: GitHub LeonardoBerti00/TLOB.

Рисунки воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY-NC-SA 4.0.

Аннотация

Прогноз ценового тренда (Price Trend Prediction, PTP) по данным книги лимитных заявок — фундаментальная задача финансовых рынков. Несмотря на прогресс глубокого обучения, существующие модели плохо обобщаются на разные рыночные условия и активы. Неожиданно: адаптировав простую MLP-архитектуру к LOB, мы превосходим SoTA — что ставит под вопрос необходимость сложных архитектур. В отличие от прошлых работ с проблемами робастности, мы предлагаем TLOB — трансформер с двойным вниманием, улавливающим пространственные и временны́е зависимости в данных книги. Он адаптивно фокусируется на микроструктуре и особенно эффективен на длинных горизонтах и в волатильных условиях. Мы также вводим новый метод разметки, устраняющий horizon bias. На бенчмарке FI-2010 TLOB превышает SoTA в среднем на 3.7 пункта F1 по четырём горизонтам; на Tesla и Intel — прирост F1 1.3 и 7.7; на недавнем датасете Bitcoin — 1.1. Эмпирически показано падение предсказуемости акций со временем (−6.68 F1), что согласуется с ростом эффективности рынка. Предсказуемость нужно рассматривать относительно транзакционных издержек: при определении тренда через средний спред качество заметно ухудшается — перевод классификации тренда в прибыльную стратегию сложен. Работа даёт новый взгляд на эволюцию задачи PTP и основу для дальнейших исследований в финансовом ИИ. Код будет открыт.

1. Введение

За последние десятилетия глобальный финансовый ландшафт перешёл от ручной торговли к электронным платформам: к 2020 году электронная торговля составляла более 99% оборота акций в США против 15% в 2000 году [25]. В центре этой революции — электронная книга лимитных заявок: динамическая структура, эволюционирующая с непрерывным потоком лимиток, организованных по ценовым уровням, и отражающая баланс спроса и предложения. Многомерность (уровни цены и объёмы) усложняет понимание рынка, прогноз тренда и реалистичную симуляцию. Нестационарность и стохастичность делают моделирование движений цены трудным; классическая статистика не улавливает эти сложности на коротких горизонтах. Глубокое обучение открыло путь к нелинейным зависимостям и временны́м связям, заложенным в данных книги.

PTP (в литературе также — прогноз движения mid-цены) остаётся одной из самых экономически значимых задач. Важное применение — высокочастотная торговля, где алгоритмы пытаются капитализировать краткосрочные движения. Рынки непрерывно формируются действиями и ожиданиями участников, которые, согласно гипотезе эффективного рынка (EMH), в совокупности встраивают всю доступную информацию в цены. Когда модели обнаруживают предсказательный паттерн и трейдеры по нему действуют, аномалия быстро конкурируется: успешный сигнал сеет семена собственного исчезновения. Рост ликвидности, технологий и алгоритмических стратегий ускоряет эрозию. Падение точности прогноза в наших результатах согласуется с EMH: чем дальше от идеализированных менее ликвидных рынков (FI-2010) к активным высокоэффективным (NASDAQ), тем труднее прогноз — напряжение между поиском альфы и самокоррекцией конкурентных рынков.

Традиционные подходы опирались на теханализ и статистику; в последние годы — LSTM [38], CNN [39, 40, 45], TABL [36] и др. [24, 44, 30]. Недавняя работа [31] подчеркнула ограниченную робастность и обобщаемость существующих моделей на разнообразных условиях и более эффективных акциях. Мы закрываем этот разрыв TLOB, превосходящим существующие модели и на бенчмарке, и на реальных данных, и простой MLP-моделью, показывающей, что полностью связные слои с GeLU могут бить SoTA.

Вклады:

  1. Две архитектуры, превосходящие SoTA: MLPLOB — простой MLP, вдохновлённый недавней литературой глубокого обучения; TLOB — трансформер с двойным вниманием по времени и по признакам LOB.
  2. Обширная оценка на FI-2010, NASDAQ (Tesla, Intel) и BTC с несколькими бейзлайнами, абляция дизайна TLOB.
  3. Новый метод разметки, устраняющий смещение горизонта.
  4. Историческое сравнение: стала ли задача труднее со временем.
  5. Альтернативный порог: тренд относительно среднего спреда — основной транзакционной издержки.

2. Предварительные сведения

На современных рынках преобладающий механизм учёта сделок — электронная LOB. Трейдеры выставляют заявки на покупку или продажу заданного количества по заранее определённой цене. Три основных типа: (1) рыночные — исполняются немедленно по лучшей доступной цене; (2) лимитные — задают максимум (покупка) или минимум (продажа) цены исполнения вместе с количеством; (3) отмены (удаления) активной лимитки.

Книга поддерживает и матчит активные лимитки и маркеты по заданным правилам, прозрачна для участников и обновляется каждым событием. Наиболее распространённый механизм матчинга — непрерывный двойной аукцион (CDA) [4]: сделка происходит, когда лучший bid и лучший ask пересекаются. Цена актива обычно определяется как mid — среднее лучших ask и bid; разность — спред.

Лимитки организованы по уровням глубины, каждый с ценой и объёмом bid/ask; временна́я эволюция книги — сложная многомерная задача. Исследования LOB делятся на четыре класса: эмпирика динамики [12, 5], прогноз цены и волатильности [45, 34], стохастическое моделирование [13, 17], симуляция рынка [8, 10, 26].

Tsantekidis et al. сначала применили LSTM [39], затем CNN [38] и CNN-LSTM [40]. Tran et al. разработали Temporal Attention-Augmented Bilinear Layer (TABL) [36] и расширение BINCTABL [37] с билинейной нормализацией для нестационарности и разномасштабности. Passalis et al. ввели DAIN [30] — трёхшаговую адаптивную нормализацию (сдвиг, масштаб, гейтинг). Zhang et al. предложили DeepLOB [45] (свёртки, Inception, LSTM) и DeepLOBATT [44] с вниманием для мультигоризонтного прогноза. Kisiel, Gorse — Axial-LOB [24] с осевым вниманием, факторизующим 2D-внимание в отдельные 1D-модули по признакам и времени. Обзор и бенчмарк — Prata et al. [31].

4. Постановка задачи

Эволюцию книги представляем рядом $L$, где каждая запись $L(t)\in\mathbb{R}^{4L}$, $t=1,\ldots,N$, $L$ — число уровней:

\[ L(t) = \bigl(P^{\mathrm{ask}}(t),\, V^{\mathrm{ask}}(t),\, P^{\mathrm{bid}}(t),\, V^{\mathrm{bid}}(t)\bigr), \tag{1} \]

где цены и объёмы — векторы в $\mathbb{R}^{L}$. Тренд — троичная классификация: $U$ (рост), $D$ (падение), $S$ (стабильность, малые вариации).

На фондовых рынках mid обычно считают самым надёжным одномерным индикатором цены. Из-за флуктуаций и внешних шоков последовательные mid $p_t,p_{t+1}$ дают шумные метки. Многие стратегии сглаживают mid по окну, чтобы снизить краткосрочный шум. Пример — [29], см. разд. 6.1. Однако, как показывает Zhang et al. [45] (их рис. 2), сглаживание только будущих цен даёт нестабильные торговые сигналы, лишние сделки и выше издержки. Tsantekidis et al. [38] предложили сглаживать и прошлые цены:

\[ l(t,k)=\frac{m^{+}(t,k)-m^{-}(t,k)}{m^{-}(t,k)}, \tag{2} \] \[ m^{+}(t,k)=\frac{1}{k+1}\sum_{i=0}^{k} p(t+i),\qquad m^{-}(t,k)=\frac{1}{k+1}\sum_{i=0}^{k} p(t-i). \tag{3} \]

Ключевой недостаток: длина окна $k$ совпадает с горизонтом прогноза $h$. Это смещает метки: $h=2$ может не дать достаточного сглаживания, большой $h$ — перегладить движения.

Мы отделяем $k$ от $h$:

\[ w^{+}(t,h,k)=\frac{1}{k+1}\sum_{i=0}^{k} p(t+h-i),\qquad w^{-}(t,h,k)=\frac{1}{k+1}\sum_{i=0}^{k} p(t-i). \tag{5} \] \[ l(t,h,k)=\frac{w^{+}(t,h,k)-w^{-}(t,h,k)}{w^{-}(t,h,k)}. \tag{7} \]

Класс: рост, если $l(t,h,k)>\theta$; падение, если $l<-\theta$; иначе стабильность. Порог $\theta$ часто выбирают для баланса классов, а не из издержек. Мы утверждаем, что $\theta$ следует связывать с транзакционными издержками. В разд. 7.5 берём $\theta$ равным среднему спреду как доле mid — основной издержке. Рис. 1 сравнивает три подхода. Для сопоставимости с литературой на FI-2010 оставляем исходную разметку; на Intel и Tesla используем новую, лучше работающую при разных горизонтах.

Три метода разметки
Рис. 1. Сравнение трёх методов разметки. $t$ — текущий момент, $k$ — длина окна сглаживания, $h$ — горизонт прогноза. В предлагаемом методе (c) $k$ и $h$ задаются независимо.

5. Модели

Предлагаем две модели PTP по LOB. MLPLOB — простой MLP. TLOB — трансформер с двойным вниманием. Вход обеих — последовательность последних $T$ снапшотов по 10 уровням книги.

5.1. MLPLOB

Ключевой вывод бенчмарка Prata et al. [31]: несмотря на изобилие специализированных архитектур, качество часто сходится к низким значениям на разнообразных сложных данных. Вдохновляясь Tolstikhin et al. [35] и Zeng et al. [43], показавшими, что простые MLP могут быть на уровне SoTA в некоторых доменах, строим MLPLOB.

Обзор архитектуры. Несколько блоков, в каждом два типа MLP: (1) Feature-Mixing — вдоль оси признаков; (2) Temporal-Mixing — вдоль оси времени. Цель — уловить пространственные и временны́е связи, которые Sirignano, Cont [34, 33] считают фундаментальными для динамики книги. Каждый MLP-слой — два полносвязных слоя, как MLP-компонента трансформера [41]. Вход линейно проецируется в тензор $X\in\mathbb{R}^{T\times N}$.

Feature-Mixing применяется построчно (каждый момент $i$):

\[ U_{i,*}=\sigma\Bigl(\mathrm{LayerNorm}\bigl(\sigma(X_{i,*}W_1)W_2+X_{i,*}\bigr)\Bigr),\qquad i=1,\ldots,T. \tag{8} \]

$\sigma$ — GeLU [19]. Temporal-Mixing — по столбцам после транспонирования $U$:

\[ Z_{*,j}=\sigma\Bigl(\mathrm{LayerNorm}\bigl(\sigma(U_{*,j}W_3)W_4+U_{*,j}\bigr)\Bigr),\qquad j=1,\ldots,N. \tag{9} \]

Архитектура опирается только на умножения матриц, reshape и скалярные нелинейности и изотропна: размерность блоков (после начальной проекции) постоянна — в отличие от пирамидальных CNN. Изотропия обычна и у трансформеров, и у RNN.

Финальный прогноз. После нескольких блоков смешивания — снижение размерности в один вектор, несколько полносвязных слоёв с постепенным сжатием и классификационная голова. Выход — направление тренда (вверх / вниз / стабильно) для последнего шага. Главная цель MLPLOB — показать, что аккуратно устроенный MLP может сравниться со сложными архитектурами или превзойти их. Тот же приём применяется и к TLOB.

5.2. TLOB

Трансформер [41] дал прорывы в NLP [7, 22] и моделировании рядов [42]: длинные зависимости без столь сильного затухания градиентов, качество масштабируется с данными [21]. Объёмы финансовых LOB-данных огромны, длинные зависимости центральны для прогноза тренда — трансформеры здесь уместны.

Архитектура TLOB
Рис. 2. Обзор архитектуры TLOB. В каждом блоке — Temporal Self-Attention и Feature Self-Attention. Блок предваряется билинейной нормализацией против нестационарности, затем идёт блок MLPLOB.

Каждый блок TLOB содержит:

  1. Self-attention по снапшотам (временна́я ось) — зависимости между последовательными состояниями книги.
  2. Self-attention по признакам (пространственная ось) — связи между ценово-объёмными признаками.
  3. Блок MLPLOB вместо обычной feed-forward сети трансформера — для комбинирования пространственных и временны́х сигналов.

Стандартный трансформер обрабатывает токены вдоль одного измерения; данные книги требуют обоих осей [34, 33]. Шаг $t$ показывает, как соотносятся более глубокие и мелкие уровни и как тренды эволюционируют по прошлым снапшотам. Двойное внимание явно адресует эти две оси. Важность каждого типа — в абляции (разд. 7.6).

Билинейная нормализация. Против нестационарности и разномасштабности (цены и размеры) — слой Bilinear Normalization [37] как первый слой. В отличие от z-score, который ломается при сдвиге распределения на инференсе, билинейная нормализация адаптируется к статистикам батча. Тот же слой используется в MLPLOB.

Позиционное кодирование. Self-attention перестановочно-инвариантен, поэтому синусоидальные позиционные эмбеддинги [41] сохраняют хронологию внутри окна снапшотов.

Смешивая два различных self-attention (сначала временное, затем пространственное) с MLPLOB feed-forward, TLOB улавливает микроструктуру книги. Трансформерная основа масштабируется на большие данные, двойное внимание — на тонкие взаимодействия признаков и зависимости последовательности.

6. Эксперименты

Обучаем и тестируем MLPLOB и TLOB на FI-2010, TSLA–INTC и BTC. Обе модели превосходят SoTA на каждом датасете и каждом горизонте. TLOB лучше на длинных горизонтах, MLPLOB — на коротких. Помимо демонстрации SoTA задаём вопросы: (1) труднее ли прогнозировать акции, чем в прошлом? (2) что если $\theta$ равен среднему спреду? (3) необходимо ли временное и пространственное внимание?

6.1. Бенчмарк FI-2010

FI-2010 [29] — самый используемый LOB-датасет в глубоком обучении [45, 46, 38, 39]. Пять финских компаний NASDAQ Nordic (Kesko, Outokumpu, Sampo, Rautaruukki, Wärtsilä), 10 торговых дней 1–14 июня 2010, около 4 млн снапшотов по 10 уровням. Авторы сэмплировали каждые десять событий: 394 337 наблюдений. Датасет предобработан, метки уже посчитаны. Метка — процентное изменение между текущим mid и средним последующих $h$ mid:

\[ l(t)=\frac{m^{+}(t,k)-p(t)}{p(t)}, \tag{10} \]

где $k$ совпадает с горизонтом $h$. Горизонты $h\in\{10,20,30,50,100\}$. Единый порог $\theta=2\times 10^{-3}$ для всех горизонтов, выбранный для баланса классов при $h=50$.

6.2. Датасет BTC

Из Kaggle, 12 последовательных дней 9–20 января 2023, бессрочные Binance BTCUSDT.P. Точки уже сэмплированы с частотой 250 мс; горизонты 10, 20, 50, 100 соответствуют 1 с, 2.5 с, 5 с и 10 с. Всего 3 730 870 строк: первые 9 дней — обучение, 10-й — валидация, последний — тест.

6.3. Датасет TSLA–INTC

В большинстве SoTA-работ используют одну–три акции, преимущественно технологического сектора [10, 28, 26, 32, 20]. Следуя этой практике, строим датасет двух акций NASDAQ — Tesla и Intel, 2–30 января 2015. Стилизованные факты и микроструктура независимы от индивидуального поведения акции [6, 5, 14, 17]. По 20 файлов книги на акцию (торговые дни), около 24 млн наблюдений. Разбиение: 17 дней обучение, 18-й валидация, последние два — тест. Датасет нельзя опубликовать из-за копирайта.

Таблица 1. Основные характеристики Intel и Tesla за январь 2015. Средняя ликвидность — средний объём на первых 10 уровнях.
АкцияДневная доходность (%)Дневной объёмСр. спредСр. ликвидность
TSLA$-0.42\pm 2.84$$23\,927\,602\pm 4\,554\,884$0.163 320
INTC$-0.44\pm 1.66$$304\,325\,400\pm 69\,340\,430$0.01124 960

Tesla и Intel дают разные рыночные ситуации: INTC — small-tick акция. Данные книги, особенно ликвидных акций, массивны: сотни тысяч заявок в день, низкое отношение сигнал/шум [27]. Не нужно учитывать каждое обновление. Временной и событийный сэмплинг не улавливают разный импакт сделок. Мы сэмплируем книгу каждые 500 проторгованных акций — компромисс между временно́й согласованностью внутри окон и значимой вариацией между наблюдениями.

6.4. Настройки экспериментов

Для каждого датасета — горизонты 10, 20, 50, 100. Железо: RTX 3090. На FI-2010 дополнительно используем 104 рукотворных признака из книги: это поднимает F1 примерно на 1. Для Tesla и Intel конкатенируем снапшоты с соответствующими сообщениями о заявках: плюс около 1.5 F1. Поиск гиперпараметров — в приложении A.

Бейзлайны. Три ML-модели: SVM, Random Forest, XGBoost; десять DL SoTA: MLP, LSTM [38], CNN [39], CTABL [36], DAIN [30], CNNLSTM [40], DeepLOB [45], BiN-CTABL [37], AxialLOB [23], DLA [18]. Из вычислительных ограничений на TSLA–INTC и BTC обучаем только две лучшие модели из [31]: DeepLOB и BiNCTABL.

Таблица 2. Число параметров и время инференса.
МодельПараметрыИнференс (мс)
MLP$10^{6}$0.08
LSTM [39]$1.6\cdot 10^{4}$0.21
CNN [38]$3.5\cdot 10^{4}$0.36
CTABL [36]$1.1\cdot 10^{4}$0.48
DAIN-MLP [30]$5.3\cdot 10^{4}$0.50
CNNLSTM [40]$2.8\cdot 10^{5}$0.49
AxialLOB [23]$2\cdot 10^{4}$1.91
DLA [18]$1.2\cdot 10^{5}$0.23
DeepLOB [45]$1.4\cdot 10^{5}$1.31
BiNCTABL [37]$1.1\cdot 10^{4}$0.71
MLPLOB$6.3\cdot 10^{7}$4.79
TLOB$1\cdot 10^{7}$2.24

TLOB и MLPLOB имеют больше параметров, чем типичные LOB-модели, но всё ещё значительно меньше современных DL-моделей общих задач. Инференс чуть медленнее, но достаточен для HFT-сценариев.

Порог $\theta$. На TSLA–INTC и BTC для баланса классов берём среднее процентное изменение. В разд. 7.5 — альтернатива на финансовых параметрах. На FI-2010 оставляем исходные метки для сопоставимости с бенчмарком.

Метрика. Основная — F1: точность невалидна из-за дисбаланса классов на разных горизонтах. F1 устойчива к дисбалансу и наиболее употребима в SoTA по PTP. Кривые precision–recall — в приложении B.

7. Результаты

Таблица 3. F1 (%) на FI-2010. Жирным — лучшие значения.
Модель$h=10$$h=20$$h=50$$h=100$
SVM35.943.249.451.2
Random Forest48.746.351.253.9
XGBoost62.459.665.367.6
MLP48.244.049.051.6
LSTM [39]66.558.866.959.4
CNN [38]49.346.165.867.2
CTABL [36]69.562.471.673.9
DAIN-MLP [30]53.946.761.262.8
CNNLSTM [40]63.549.169.271.0
AxialLOB [23]73.263.478.379.2
DLA [18]79.469.387.152.2
DeepLOB [45]71.162.475.477.6
BiNCTABL [37]81.171.587.792.1
MLPLOB81.6484.8891.3992.62
TLOB81.5582.6890.0392.81

7.1. FI-2010

MLPLOB и TLOB показывают очень высокую точность даже при высоком полноте и стабильно выше precision на всех уровнях recall, чем остальные модели. Бейзлайны взяты из бенчмарка Prata et al. [31] при тех же настройках. MLPLOB и TLOB превосходят все SoTA LOB-модели. Разрыв между MLPLOB и TLOB минимален — из-за меньшей сложности FI-2010, что объясняет ненужность более сложной архитектуры именно на этом датасете. Горизонты соответствуют исходным определениям FI-2010 (число событий до сэмплинга бенчмарка).

7.2. Tesla и Intel

Таблица 4. F1 (%) Tesla.
Модель$h=10$$h=20$$h=50$$h=100$
DeepLOB36.2536.5835.2934.43
BiNCTABL58.6948.8342.2338.77
MLPLOB60.7250.2538.9732.95
TLOB60.5049.7443.4839.84
Таблица 5. F1 (%) Intel.
Модель$h=10$$h=20$$h=50$$h=100$
DeepLOB68.1363.7040.330.1
BiNCTABL72.6566.5753.9941.08
MLPLOB81.1573.2555.7443.18
TLOB80.1572.7562.0750.14

Для каждой акции — своя модель. Кривые precision–recall при $h=100$ — Рис. 3–4. На INTC модели показывают отличную точность при низком полноте. MLPLOB лучше всех на коротких горизонтах (10, 20), TLOB — на длинных (50, 100): трансформеры сильны на дальних зависимостях. Разрыв MLPLOB vs TLOB на коротких горизонтах минимален ($\approx 0.5$), на длинных значим ($\approx 7$). Чем длиннее горизонт, тем труднее прогноз. В целом качество намного ниже, чем на FI-2010: финские акции 2010 года менее ликвидны и эффективны, чем NASDAQ Tesla/Intel, плюс данные старше — см. следующий эксперимент. TLOB и MLPLOB сходятся менее чем за половину эпох BiNCTABL и DeepLOB.

Precision-Recall INTC
Рис. 3. Кривая precision–recall для INTC, горизонт 100.
Precision-Recall TSLA
Рис. 4. Кривая precision–recall для TSLA, горизонт 100.

7.3. BTC

Таблица 6. F1 (%) Bitcoin (2023).
Модель$h=10$$h=20$$h=50$$h=100$
DeepLOB68.0757.8745.1337.43
BiNCTABL73.461.3447.0540.59
MLPLOB74.661.0242.7436.97
TLOB74.761.7448.5441.49

Это самый свежий датасет. В отличие от остальных, TLOB лучше всех на каждом горизонте. Устойчивое доминирование на волатильном активе 2023 года говорит о способности архитектуры улавливать современную динамику. Разрыв с MLPLOB расширяется на $h=50,100$ ($\approx 5$), на коротких минимален ($\approx 0.5$).

7.4. Труднее ли прогнозировать акции, чем раньше?

Таблица 7. F1 (%) Intel, горизонт 50: 2012 vs 2015.
МодельINTC 2015INTC 2012
TLOB60.1966.87

Эксперимент проверяет самоуничтожение предсказуемых паттернов. Модели, работавшие в одни периоды, устаревают. Dimson, Marsh [16] — для UK small-cap premium; Bossaerts, Hillion [3] — спад международной предсказуемости около 1990; Aiolfi, Favero [1] — аналогично для США в 1990-х. Рынок становится эффективнее. Сравниваем TLOB на дне Intel 21.06.2012 (публичный сэмпл LOBSTER, единственный доступный день — без cherry-picking; сотни тысяч заявок, статистически значимо) и 30.01.2015. 2012 лучше 2015: гипотеза подтверждается. Падение F1 около 6.7 пункта.

7.5. Альтернативный порог: средний спред

Таблица 8. F1 (%) Tesla при $\theta$ равном среднему спреду.
Модель$h=50$$h=100$$h=200$
TLOB41.3936.4830.82

Предсказуемость имеет смысл только относительно издержек. Берём $\theta$ равным среднему спреду как доле mid. Метод применим только к Tesla: у Intel объём примерно в 10 раз выше (январь 2015) и ниже волатильность относительно проторгованных акций — 99.99% трендов были бы «стабильными». Горизонты 50, 100, 200: на более коротких 99% движений mid классифицировались бы как стационарные. Качество падает, вероятно из-за дисбаланса классов. Эксперимент подчёркивает необходимость доработки определения тренда, если цель — прибыльность на практике.

7.6. Абляционное исследование

Таблица 9. Абляция на FI-2010, F1 (%). Полный TLOB: 4 временных + 4 пространственных слоя внимания; без SA — 8 временных; без TA — 8 пространственных.
Модель$h=10$$h=20$$h=50$$h=100$
TLOB без SA79.5978.9687.5191.40
TLOB без TA80.2779.2087.7291.42
TLOB81.5582.6890.0392.81

Полная модель с обоими механизмами внимания стабильно лучше обеих усечённых версий на всех горизонтах: двойное внимание учит комплементарную информацию.

8. Заключение

Предложены MLPLOB и TLOB для прогноза тренда по LOB. Обе превзошли SoTA на FI-2010, NASDAQ (Tesla, Intel) и Bitcoin, особенно на длинных горизонтах. Определение порога тренда через средний спред (транзакционные издержки) существенно влияет на метрики и потенциальную прибыльность — разрыв между ML-метриками и торговой применимостью.

Будущая работа: scaling laws финансовых DL-моделей; более робастные подходы к растущей эффективности рынка; альтернативные определения тренда, лучше согласованные с торговыми ограничениями; обширный анализ прибыльности через бэктест или продвинутые симуляции рынка [10, 11, 2].

Ограничения. Методологии недостаточно зрелы для живой торговли. Порог по спреду сильно меняет оценку и потенциальную прибыль.

Риски. Автоматизированные ML-модели, встраиваемые в рынки, несут риски финансовой стабильности: могут усиливать системные уязвимости, запускать быстрые массовые реакции, повышать волатильность и вести к каскадным сбоям.

Приложения

A. Поиск гиперпараметров

Сеточный поиск — Таблица 10. Для DeepLOB и BiNCTABL использованы параметры [31] после большого поиска. При длине последовательности больше 128 качество выходит на плато. Число голов внимания TLOB: разницы между 1, 2 и 4 не было, фиксируем 1.

Таблица 10. Пространства поиска и лучшие значения.
ГиперпараметрПространствоTLOBMLPLOB
Оптимизатор{Adam [15], Lion [9]}AdamAdam
Длина последовательности{64, 128, 256, 384, 512}128384
Learning rate{0.001, 0.0003, 0.0001}0.00010.003
Число слоёв{2, 3, 4, 6}43

B. Дополнительные результаты

Кривые precision–recall для INTC и TSLA при горизонте 100 — Рис. 3 и 4. TLOB и MLPLOB стабильно дают более высокую точность на всех уровнях полноты. На INTC — отличная точность при низком полноте (уверенные положительные примеры). На FI-2010 точность остаётся высокой и при высоком полноте.

Литература

  1. Aiolfi, M. and Favero, C. A. (2005). Model uncertainty, thick modelling and the predictability of stock returns. Journal of Forecasting, 24(4):233–254.
  2. Berti, L., Prenkaj, B. and Velardi, P. (2025). TRADES: Generating realistic market simulations with diffusion models. arXiv:2502.07071.
  3. Bossaerts, P. and Hillion, P. (1999). Implementing statistical criteria to select return forecasting models. Review of Financial Studies, 12(2):405–428.
  4. Bouchaud, J., Bonart, J., Donier, J. and Gould, M. (2018). Trades, Quotes and Prices. Cambridge University Press.
  5. Bouchaud, J.-P., Mézard, M. and Potters, M. (2002). Statistical properties of stock order books. Quantitative Finance, 2(4):251.
  6. Bouchaud, J.-P., Farmer, J. D. and Lillo, F. (2009). How markets slowly digest changes in supply and demand. In Handbook of Financial Markets, Elsevier.
  7. Brown, T. B. (2020). Language models are few-shot learners. arXiv:2005.14165.
  8. Byrd, D., Hybinette, M. and Balch, T. H. (2020). ABIDES: Towards high-fidelity multi-agent market simulation. PADS.
  9. Chen, X. et al. (2024). Symbolic discovery of optimization algorithms. NeurIPS, 36.
  10. Coletta, A. et al. (2021). Towards realistic market simulations: a GAN approach. ICAIF.
  11. Coletta, A. et al. (2022). Learning to simulate realistic limit order book markets. ICAIF.
  12. Cont, R. (2001). Empirical properties of asset returns. Quantitative Finance, 1(2):223.
  13. Cont, R. (2011). Statistical modeling of high-frequency financial data. IEEE Signal Processing Magazine, 28(5):16–25.
  14. Cont, R., Kukanov, A. and Stoikov, S. (2014). The price impact of order book events. Journal of Financial Econometrics, 12(1):47–88.
  15. Kingma, D. P. and Ba, J. (2014). Adam: A method for stochastic optimization.
  16. Dimson, E. and Marsh, P. (1999). Murphy’s law and market anomalies. Journal of Portfolio Management, 25(2):53–69.
  17. Gould, M. D. et al. (2013). Limit order books. Quantitative Finance, 13(11):1709–1742.
  18. Guo, Y. and Chen, X. (2023). Forecasting mid-price movements with high-frequency LOB. Arabian Journal for Science and Engineering, 48(8):9597–9618.
  19. Hendrycks, D. and Gimpel, K. (2016). Gaussian error linear units (GELUs). arXiv:1606.08415.
  20. Kaplan, J. et al. (2020). Scaling laws for neural language models. arXiv:2001.08361.
  21. Kisiel, D. and Gorse, D. (2022). Axial-LOB: High-frequency trading with axial attention. IEEE SSCI.
  22. Kissell, R. (2020). Algorithmic Trading Methods. Academic Press.
  23. Nagel, S. (2021). Machine Learning in Asset Pricing. Princeton University Press.
  24. Ntakaris, A. et al. Benchmark dataset for mid-price forecasting of LOB data.
  25. Passalis, N. et al. (2019). Deep adaptive input normalization for time series forecasting. IEEE TNNLS, 31(9):3760–3765.
  26. Prata, M. et al. (2024). LOB-based deep learning models for stock price trend prediction: a benchmark study. Artificial Intelligence Review, 57(5):1–45.
  27. Sirignano, J. and Cont, R. (2021). Universal features of price formation. In Machine Learning and AI in Finance.
  28. Sirignano, J. A. (2019). Deep learning for limit order books. Quantitative Finance, 19(4):549–570.
  29. Tolstikhin, I. O. et al. (2021). MLP-Mixer: An all-MLP architecture for vision. NeurIPS, 34.
  30. Tran, D. T. et al. (2018). Temporal attention-augmented bilinear network. IEEE TNNLS, 30(5):1407–1418.
  31. Tran, D. T. et al. (2021). Data normalization for bilinear structures in HFT time-series. ICPR.
  32. Tsantekidis, A. et al. (2017). Forecasting stock prices from the LOB using CNNs. CBI.
  33. Tsantekidis, A. et al. (2017). Using deep learning to detect price change indications. EUSIPCO.
  34. Tsantekidis, A. et al. (2020). Using deep learning for price prediction by exploiting stationary LOB features. Applied Soft Computing, 93:106401.
  35. Vaswani, A. et al. (2017). Attention is all you need. NeurIPS, 30.
  36. Wen, Q. et al. (2022). Transformers in time series: A survey. arXiv:2202.07125.
  37. Zeng, A. et al. (2023). Are transformers effective for time series forecasting? AAAI, 37.
  38. Zhang, Z. and Zohren, S. (2021). Multi-horizon forecasting for limit order books. arXiv:2105.10430.
  39. Zhang, Z., Zohren, S. and Roberts, S. (2019). DeepLOB: Deep convolutional neural networks for limit order books. IEEE TSP, 67(11):3001–3012.

Перевод выполнен с сохранением структуры, формул и таблиц оригинала. Оригинал: arXiv:2502.15757 · код: GitHub · Berti, Kasneci · CC BY-NC-SA 4.0.