TLOB: трансформер с двойным вниманием для прогноза ценового тренда по данным книги лимитных заявок
Леонардо Берти, Гьерджи Каснеци · Sapienza University of Rome / Technical University of Munich · 7 мая 2025 (v3)
Оригинал: Berti, L., Kasneci, G. «TLOB: A Novel Transformer Model with Dual Attention for Price Trend Prediction with Limit Order Book Data», 2025 — arxiv.org/abs/2502.15757 (PDF), лицензия CC BY-NC-SA 4.0. Код: GitHub LeonardoBerti00/TLOB.
Рисунки воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY-NC-SA 4.0.
Аннотация
Прогноз ценового тренда (Price Trend Prediction, PTP) по данным книги лимитных заявок — фундаментальная задача финансовых рынков. Несмотря на прогресс глубокого обучения, существующие модели плохо обобщаются на разные рыночные условия и активы. Неожиданно: адаптировав простую MLP-архитектуру к LOB, мы превосходим SoTA — что ставит под вопрос необходимость сложных архитектур. В отличие от прошлых работ с проблемами робастности, мы предлагаем TLOB — трансформер с двойным вниманием, улавливающим пространственные и временны́е зависимости в данных книги. Он адаптивно фокусируется на микроструктуре и особенно эффективен на длинных горизонтах и в волатильных условиях. Мы также вводим новый метод разметки, устраняющий horizon bias. На бенчмарке FI-2010 TLOB превышает SoTA в среднем на 3.7 пункта F1 по четырём горизонтам; на Tesla и Intel — прирост F1 1.3 и 7.7; на недавнем датасете Bitcoin — 1.1. Эмпирически показано падение предсказуемости акций со временем (−6.68 F1), что согласуется с ростом эффективности рынка. Предсказуемость нужно рассматривать относительно транзакционных издержек: при определении тренда через средний спред качество заметно ухудшается — перевод классификации тренда в прибыльную стратегию сложен. Работа даёт новый взгляд на эволюцию задачи PTP и основу для дальнейших исследований в финансовом ИИ. Код будет открыт.
1. Введение
За последние десятилетия глобальный финансовый ландшафт перешёл от ручной торговли к электронным платформам: к 2020 году электронная торговля составляла более 99% оборота акций в США против 15% в 2000 году [25]. В центре этой революции — электронная книга лимитных заявок: динамическая структура, эволюционирующая с непрерывным потоком лимиток, организованных по ценовым уровням, и отражающая баланс спроса и предложения. Многомерность (уровни цены и объёмы) усложняет понимание рынка, прогноз тренда и реалистичную симуляцию. Нестационарность и стохастичность делают моделирование движений цены трудным; классическая статистика не улавливает эти сложности на коротких горизонтах. Глубокое обучение открыло путь к нелинейным зависимостям и временны́м связям, заложенным в данных книги.
PTP (в литературе также — прогноз движения mid-цены) остаётся одной из самых экономически значимых задач. Важное применение — высокочастотная торговля, где алгоритмы пытаются капитализировать краткосрочные движения. Рынки непрерывно формируются действиями и ожиданиями участников, которые, согласно гипотезе эффективного рынка (EMH), в совокупности встраивают всю доступную информацию в цены. Когда модели обнаруживают предсказательный паттерн и трейдеры по нему действуют, аномалия быстро конкурируется: успешный сигнал сеет семена собственного исчезновения. Рост ликвидности, технологий и алгоритмических стратегий ускоряет эрозию. Падение точности прогноза в наших результатах согласуется с EMH: чем дальше от идеализированных менее ликвидных рынков (FI-2010) к активным высокоэффективным (NASDAQ), тем труднее прогноз — напряжение между поиском альфы и самокоррекцией конкурентных рынков.
Традиционные подходы опирались на теханализ и статистику; в последние годы — LSTM [38], CNN [39, 40, 45], TABL [36] и др. [24, 44, 30]. Недавняя работа [31] подчеркнула ограниченную робастность и обобщаемость существующих моделей на разнообразных условиях и более эффективных акциях. Мы закрываем этот разрыв TLOB, превосходящим существующие модели и на бенчмарке, и на реальных данных, и простой MLP-моделью, показывающей, что полностью связные слои с GeLU могут бить SoTA.
Вклады:
- Две архитектуры, превосходящие SoTA: MLPLOB — простой MLP, вдохновлённый недавней литературой глубокого обучения; TLOB — трансформер с двойным вниманием по времени и по признакам LOB.
- Обширная оценка на FI-2010, NASDAQ (Tesla, Intel) и BTC с несколькими бейзлайнами, абляция дизайна TLOB.
- Новый метод разметки, устраняющий смещение горизонта.
- Историческое сравнение: стала ли задача труднее со временем.
- Альтернативный порог: тренд относительно среднего спреда — основной транзакционной издержки.
2. Предварительные сведения
На современных рынках преобладающий механизм учёта сделок — электронная LOB. Трейдеры выставляют заявки на покупку или продажу заданного количества по заранее определённой цене. Три основных типа: (1) рыночные — исполняются немедленно по лучшей доступной цене; (2) лимитные — задают максимум (покупка) или минимум (продажа) цены исполнения вместе с количеством; (3) отмены (удаления) активной лимитки.
Книга поддерживает и матчит активные лимитки и маркеты по заданным правилам, прозрачна для участников и обновляется каждым событием. Наиболее распространённый механизм матчинга — непрерывный двойной аукцион (CDA) [4]: сделка происходит, когда лучший bid и лучший ask пересекаются. Цена актива обычно определяется как mid — среднее лучших ask и bid; разность — спред.
Лимитки организованы по уровням глубины, каждый с ценой и объёмом bid/ask; временна́я эволюция книги — сложная многомерная задача. Исследования LOB делятся на четыре класса: эмпирика динамики [12, 5], прогноз цены и волатильности [45, 34], стохастическое моделирование [13, 17], симуляция рынка [8, 10, 26].
3. Связанные работы
Tsantekidis et al. сначала применили LSTM [39], затем CNN [38] и CNN-LSTM [40]. Tran et al. разработали Temporal Attention-Augmented Bilinear Layer (TABL) [36] и расширение BINCTABL [37] с билинейной нормализацией для нестационарности и разномасштабности. Passalis et al. ввели DAIN [30] — трёхшаговую адаптивную нормализацию (сдвиг, масштаб, гейтинг). Zhang et al. предложили DeepLOB [45] (свёртки, Inception, LSTM) и DeepLOBATT [44] с вниманием для мультигоризонтного прогноза. Kisiel, Gorse — Axial-LOB [24] с осевым вниманием, факторизующим 2D-внимание в отдельные 1D-модули по признакам и времени. Обзор и бенчмарк — Prata et al. [31].
4. Постановка задачи
Эволюцию книги представляем рядом $L$, где каждая запись $L(t)\in\mathbb{R}^{4L}$, $t=1,\ldots,N$, $L$ — число уровней:
\[ L(t) = \bigl(P^{\mathrm{ask}}(t),\, V^{\mathrm{ask}}(t),\, P^{\mathrm{bid}}(t),\, V^{\mathrm{bid}}(t)\bigr), \tag{1} \]где цены и объёмы — векторы в $\mathbb{R}^{L}$. Тренд — троичная классификация: $U$ (рост), $D$ (падение), $S$ (стабильность, малые вариации).
На фондовых рынках mid обычно считают самым надёжным одномерным индикатором цены. Из-за флуктуаций и внешних шоков последовательные mid $p_t,p_{t+1}$ дают шумные метки. Многие стратегии сглаживают mid по окну, чтобы снизить краткосрочный шум. Пример — [29], см. разд. 6.1. Однако, как показывает Zhang et al. [45] (их рис. 2), сглаживание только будущих цен даёт нестабильные торговые сигналы, лишние сделки и выше издержки. Tsantekidis et al. [38] предложили сглаживать и прошлые цены:
\[ l(t,k)=\frac{m^{+}(t,k)-m^{-}(t,k)}{m^{-}(t,k)}, \tag{2} \] \[ m^{+}(t,k)=\frac{1}{k+1}\sum_{i=0}^{k} p(t+i),\qquad m^{-}(t,k)=\frac{1}{k+1}\sum_{i=0}^{k} p(t-i). \tag{3} \]Ключевой недостаток: длина окна $k$ совпадает с горизонтом прогноза $h$. Это смещает метки: $h=2$ может не дать достаточного сглаживания, большой $h$ — перегладить движения.
Мы отделяем $k$ от $h$:
\[ w^{+}(t,h,k)=\frac{1}{k+1}\sum_{i=0}^{k} p(t+h-i),\qquad w^{-}(t,h,k)=\frac{1}{k+1}\sum_{i=0}^{k} p(t-i). \tag{5} \] \[ l(t,h,k)=\frac{w^{+}(t,h,k)-w^{-}(t,h,k)}{w^{-}(t,h,k)}. \tag{7} \]Класс: рост, если $l(t,h,k)>\theta$; падение, если $l<-\theta$; иначе стабильность. Порог $\theta$ часто выбирают для баланса классов, а не из издержек. Мы утверждаем, что $\theta$ следует связывать с транзакционными издержками. В разд. 7.5 берём $\theta$ равным среднему спреду как доле mid — основной издержке. Рис. 1 сравнивает три подхода. Для сопоставимости с литературой на FI-2010 оставляем исходную разметку; на Intel и Tesla используем новую, лучше работающую при разных горизонтах.
5. Модели
Предлагаем две модели PTP по LOB. MLPLOB — простой MLP. TLOB — трансформер с двойным вниманием. Вход обеих — последовательность последних $T$ снапшотов по 10 уровням книги.
5.1. MLPLOB
Ключевой вывод бенчмарка Prata et al. [31]: несмотря на изобилие специализированных архитектур, качество часто сходится к низким значениям на разнообразных сложных данных. Вдохновляясь Tolstikhin et al. [35] и Zeng et al. [43], показавшими, что простые MLP могут быть на уровне SoTA в некоторых доменах, строим MLPLOB.
Обзор архитектуры. Несколько блоков, в каждом два типа MLP: (1) Feature-Mixing — вдоль оси признаков; (2) Temporal-Mixing — вдоль оси времени. Цель — уловить пространственные и временны́е связи, которые Sirignano, Cont [34, 33] считают фундаментальными для динамики книги. Каждый MLP-слой — два полносвязных слоя, как MLP-компонента трансформера [41]. Вход линейно проецируется в тензор $X\in\mathbb{R}^{T\times N}$.
Feature-Mixing применяется построчно (каждый момент $i$):
\[ U_{i,*}=\sigma\Bigl(\mathrm{LayerNorm}\bigl(\sigma(X_{i,*}W_1)W_2+X_{i,*}\bigr)\Bigr),\qquad i=1,\ldots,T. \tag{8} \]$\sigma$ — GeLU [19]. Temporal-Mixing — по столбцам после транспонирования $U$:
\[ Z_{*,j}=\sigma\Bigl(\mathrm{LayerNorm}\bigl(\sigma(U_{*,j}W_3)W_4+U_{*,j}\bigr)\Bigr),\qquad j=1,\ldots,N. \tag{9} \]Архитектура опирается только на умножения матриц, reshape и скалярные нелинейности и изотропна: размерность блоков (после начальной проекции) постоянна — в отличие от пирамидальных CNN. Изотропия обычна и у трансформеров, и у RNN.
Финальный прогноз. После нескольких блоков смешивания — снижение размерности в один вектор, несколько полносвязных слоёв с постепенным сжатием и классификационная голова. Выход — направление тренда (вверх / вниз / стабильно) для последнего шага. Главная цель MLPLOB — показать, что аккуратно устроенный MLP может сравниться со сложными архитектурами или превзойти их. Тот же приём применяется и к TLOB.
5.2. TLOB
Трансформер [41] дал прорывы в NLP [7, 22] и моделировании рядов [42]: длинные зависимости без столь сильного затухания градиентов, качество масштабируется с данными [21]. Объёмы финансовых LOB-данных огромны, длинные зависимости центральны для прогноза тренда — трансформеры здесь уместны.
Каждый блок TLOB содержит:
- Self-attention по снапшотам (временна́я ось) — зависимости между последовательными состояниями книги.
- Self-attention по признакам (пространственная ось) — связи между ценово-объёмными признаками.
- Блок MLPLOB вместо обычной feed-forward сети трансформера — для комбинирования пространственных и временны́х сигналов.
Стандартный трансформер обрабатывает токены вдоль одного измерения; данные книги требуют обоих осей [34, 33]. Шаг $t$ показывает, как соотносятся более глубокие и мелкие уровни и как тренды эволюционируют по прошлым снапшотам. Двойное внимание явно адресует эти две оси. Важность каждого типа — в абляции (разд. 7.6).
Билинейная нормализация. Против нестационарности и разномасштабности (цены и размеры) — слой Bilinear Normalization [37] как первый слой. В отличие от z-score, который ломается при сдвиге распределения на инференсе, билинейная нормализация адаптируется к статистикам батча. Тот же слой используется в MLPLOB.
Позиционное кодирование. Self-attention перестановочно-инвариантен, поэтому синусоидальные позиционные эмбеддинги [41] сохраняют хронологию внутри окна снапшотов.
Смешивая два различных self-attention (сначала временное, затем пространственное) с MLPLOB feed-forward, TLOB улавливает микроструктуру книги. Трансформерная основа масштабируется на большие данные, двойное внимание — на тонкие взаимодействия признаков и зависимости последовательности.
6. Эксперименты
Обучаем и тестируем MLPLOB и TLOB на FI-2010, TSLA–INTC и BTC. Обе модели превосходят SoTA на каждом датасете и каждом горизонте. TLOB лучше на длинных горизонтах, MLPLOB — на коротких. Помимо демонстрации SoTA задаём вопросы: (1) труднее ли прогнозировать акции, чем в прошлом? (2) что если $\theta$ равен среднему спреду? (3) необходимо ли временное и пространственное внимание?
6.1. Бенчмарк FI-2010
FI-2010 [29] — самый используемый LOB-датасет в глубоком обучении [45, 46, 38, 39]. Пять финских компаний NASDAQ Nordic (Kesko, Outokumpu, Sampo, Rautaruukki, Wärtsilä), 10 торговых дней 1–14 июня 2010, около 4 млн снапшотов по 10 уровням. Авторы сэмплировали каждые десять событий: 394 337 наблюдений. Датасет предобработан, метки уже посчитаны. Метка — процентное изменение между текущим mid и средним последующих $h$ mid:
\[ l(t)=\frac{m^{+}(t,k)-p(t)}{p(t)}, \tag{10} \]где $k$ совпадает с горизонтом $h$. Горизонты $h\in\{10,20,30,50,100\}$. Единый порог $\theta=2\times 10^{-3}$ для всех горизонтов, выбранный для баланса классов при $h=50$.
6.2. Датасет BTC
Из Kaggle, 12 последовательных дней 9–20 января 2023, бессрочные Binance BTCUSDT.P. Точки уже сэмплированы с частотой 250 мс; горизонты 10, 20, 50, 100 соответствуют 1 с, 2.5 с, 5 с и 10 с. Всего 3 730 870 строк: первые 9 дней — обучение, 10-й — валидация, последний — тест.
6.3. Датасет TSLA–INTC
В большинстве SoTA-работ используют одну–три акции, преимущественно технологического сектора [10, 28, 26, 32, 20]. Следуя этой практике, строим датасет двух акций NASDAQ — Tesla и Intel, 2–30 января 2015. Стилизованные факты и микроструктура независимы от индивидуального поведения акции [6, 5, 14, 17]. По 20 файлов книги на акцию (торговые дни), около 24 млн наблюдений. Разбиение: 17 дней обучение, 18-й валидация, последние два — тест. Датасет нельзя опубликовать из-за копирайта.
| Акция | Дневная доходность (%) | Дневной объём | Ср. спред | Ср. ликвидность |
|---|---|---|---|---|
| TSLA | $-0.42\pm 2.84$ | $23\,927\,602\pm 4\,554\,884$ | 0.16 | 3 320 |
| INTC | $-0.44\pm 1.66$ | $304\,325\,400\pm 69\,340\,430$ | 0.01 | 124 960 |
Tesla и Intel дают разные рыночные ситуации: INTC — small-tick акция. Данные книги, особенно ликвидных акций, массивны: сотни тысяч заявок в день, низкое отношение сигнал/шум [27]. Не нужно учитывать каждое обновление. Временной и событийный сэмплинг не улавливают разный импакт сделок. Мы сэмплируем книгу каждые 500 проторгованных акций — компромисс между временно́й согласованностью внутри окон и значимой вариацией между наблюдениями.
6.4. Настройки экспериментов
Для каждого датасета — горизонты 10, 20, 50, 100. Железо: RTX 3090. На FI-2010 дополнительно используем 104 рукотворных признака из книги: это поднимает F1 примерно на 1. Для Tesla и Intel конкатенируем снапшоты с соответствующими сообщениями о заявках: плюс около 1.5 F1. Поиск гиперпараметров — в приложении A.
Бейзлайны. Три ML-модели: SVM, Random Forest, XGBoost; десять DL SoTA: MLP, LSTM [38], CNN [39], CTABL [36], DAIN [30], CNNLSTM [40], DeepLOB [45], BiN-CTABL [37], AxialLOB [23], DLA [18]. Из вычислительных ограничений на TSLA–INTC и BTC обучаем только две лучшие модели из [31]: DeepLOB и BiNCTABL.
| Модель | Параметры | Инференс (мс) |
|---|---|---|
| MLP | $10^{6}$ | 0.08 |
| LSTM [39] | $1.6\cdot 10^{4}$ | 0.21 |
| CNN [38] | $3.5\cdot 10^{4}$ | 0.36 |
| CTABL [36] | $1.1\cdot 10^{4}$ | 0.48 |
| DAIN-MLP [30] | $5.3\cdot 10^{4}$ | 0.50 |
| CNNLSTM [40] | $2.8\cdot 10^{5}$ | 0.49 |
| AxialLOB [23] | $2\cdot 10^{4}$ | 1.91 |
| DLA [18] | $1.2\cdot 10^{5}$ | 0.23 |
| DeepLOB [45] | $1.4\cdot 10^{5}$ | 1.31 |
| BiNCTABL [37] | $1.1\cdot 10^{4}$ | 0.71 |
| MLPLOB | $6.3\cdot 10^{7}$ | 4.79 |
| TLOB | $1\cdot 10^{7}$ | 2.24 |
TLOB и MLPLOB имеют больше параметров, чем типичные LOB-модели, но всё ещё значительно меньше современных DL-моделей общих задач. Инференс чуть медленнее, но достаточен для HFT-сценариев.
Порог $\theta$. На TSLA–INTC и BTC для баланса классов берём среднее процентное изменение. В разд. 7.5 — альтернатива на финансовых параметрах. На FI-2010 оставляем исходные метки для сопоставимости с бенчмарком.
Метрика. Основная — F1: точность невалидна из-за дисбаланса классов на разных горизонтах. F1 устойчива к дисбалансу и наиболее употребима в SoTA по PTP. Кривые precision–recall — в приложении B.
7. Результаты
| Модель | $h=10$ | $h=20$ | $h=50$ | $h=100$ |
|---|---|---|---|---|
| SVM | 35.9 | 43.2 | 49.4 | 51.2 |
| Random Forest | 48.7 | 46.3 | 51.2 | 53.9 |
| XGBoost | 62.4 | 59.6 | 65.3 | 67.6 |
| MLP | 48.2 | 44.0 | 49.0 | 51.6 |
| LSTM [39] | 66.5 | 58.8 | 66.9 | 59.4 |
| CNN [38] | 49.3 | 46.1 | 65.8 | 67.2 |
| CTABL [36] | 69.5 | 62.4 | 71.6 | 73.9 |
| DAIN-MLP [30] | 53.9 | 46.7 | 61.2 | 62.8 |
| CNNLSTM [40] | 63.5 | 49.1 | 69.2 | 71.0 |
| AxialLOB [23] | 73.2 | 63.4 | 78.3 | 79.2 |
| DLA [18] | 79.4 | 69.3 | 87.1 | 52.2 |
| DeepLOB [45] | 71.1 | 62.4 | 75.4 | 77.6 |
| BiNCTABL [37] | 81.1 | 71.5 | 87.7 | 92.1 |
| MLPLOB | 81.64 | 84.88 | 91.39 | 92.62 |
| TLOB | 81.55 | 82.68 | 90.03 | 92.81 |
7.1. FI-2010
MLPLOB и TLOB показывают очень высокую точность даже при высоком полноте и стабильно выше precision на всех уровнях recall, чем остальные модели. Бейзлайны взяты из бенчмарка Prata et al. [31] при тех же настройках. MLPLOB и TLOB превосходят все SoTA LOB-модели. Разрыв между MLPLOB и TLOB минимален — из-за меньшей сложности FI-2010, что объясняет ненужность более сложной архитектуры именно на этом датасете. Горизонты соответствуют исходным определениям FI-2010 (число событий до сэмплинга бенчмарка).
7.2. Tesla и Intel
| Модель | $h=10$ | $h=20$ | $h=50$ | $h=100$ |
|---|---|---|---|---|
| DeepLOB | 36.25 | 36.58 | 35.29 | 34.43 |
| BiNCTABL | 58.69 | 48.83 | 42.23 | 38.77 |
| MLPLOB | 60.72 | 50.25 | 38.97 | 32.95 |
| TLOB | 60.50 | 49.74 | 43.48 | 39.84 |
| Модель | $h=10$ | $h=20$ | $h=50$ | $h=100$ |
|---|---|---|---|---|
| DeepLOB | 68.13 | 63.70 | 40.3 | 30.1 |
| BiNCTABL | 72.65 | 66.57 | 53.99 | 41.08 |
| MLPLOB | 81.15 | 73.25 | 55.74 | 43.18 |
| TLOB | 80.15 | 72.75 | 62.07 | 50.14 |
Для каждой акции — своя модель. Кривые precision–recall при $h=100$ — Рис. 3–4. На INTC модели показывают отличную точность при низком полноте. MLPLOB лучше всех на коротких горизонтах (10, 20), TLOB — на длинных (50, 100): трансформеры сильны на дальних зависимостях. Разрыв MLPLOB vs TLOB на коротких горизонтах минимален ($\approx 0.5$), на длинных значим ($\approx 7$). Чем длиннее горизонт, тем труднее прогноз. В целом качество намного ниже, чем на FI-2010: финские акции 2010 года менее ликвидны и эффективны, чем NASDAQ Tesla/Intel, плюс данные старше — см. следующий эксперимент. TLOB и MLPLOB сходятся менее чем за половину эпох BiNCTABL и DeepLOB.
7.3. BTC
| Модель | $h=10$ | $h=20$ | $h=50$ | $h=100$ |
|---|---|---|---|---|
| DeepLOB | 68.07 | 57.87 | 45.13 | 37.43 |
| BiNCTABL | 73.4 | 61.34 | 47.05 | 40.59 |
| MLPLOB | 74.6 | 61.02 | 42.74 | 36.97 |
| TLOB | 74.7 | 61.74 | 48.54 | 41.49 |
Это самый свежий датасет. В отличие от остальных, TLOB лучше всех на каждом горизонте. Устойчивое доминирование на волатильном активе 2023 года говорит о способности архитектуры улавливать современную динамику. Разрыв с MLPLOB расширяется на $h=50,100$ ($\approx 5$), на коротких минимален ($\approx 0.5$).
7.4. Труднее ли прогнозировать акции, чем раньше?
| Модель | INTC 2015 | INTC 2012 |
|---|---|---|
| TLOB | 60.19 | 66.87 |
Эксперимент проверяет самоуничтожение предсказуемых паттернов. Модели, работавшие в одни периоды, устаревают. Dimson, Marsh [16] — для UK small-cap premium; Bossaerts, Hillion [3] — спад международной предсказуемости около 1990; Aiolfi, Favero [1] — аналогично для США в 1990-х. Рынок становится эффективнее. Сравниваем TLOB на дне Intel 21.06.2012 (публичный сэмпл LOBSTER, единственный доступный день — без cherry-picking; сотни тысяч заявок, статистически значимо) и 30.01.2015. 2012 лучше 2015: гипотеза подтверждается. Падение F1 около 6.7 пункта.
7.5. Альтернативный порог: средний спред
| Модель | $h=50$ | $h=100$ | $h=200$ |
|---|---|---|---|
| TLOB | 41.39 | 36.48 | 30.82 |
Предсказуемость имеет смысл только относительно издержек. Берём $\theta$ равным среднему спреду как доле mid. Метод применим только к Tesla: у Intel объём примерно в 10 раз выше (январь 2015) и ниже волатильность относительно проторгованных акций — 99.99% трендов были бы «стабильными». Горизонты 50, 100, 200: на более коротких 99% движений mid классифицировались бы как стационарные. Качество падает, вероятно из-за дисбаланса классов. Эксперимент подчёркивает необходимость доработки определения тренда, если цель — прибыльность на практике.
7.6. Абляционное исследование
| Модель | $h=10$ | $h=20$ | $h=50$ | $h=100$ |
|---|---|---|---|---|
| TLOB без SA | 79.59 | 78.96 | 87.51 | 91.40 |
| TLOB без TA | 80.27 | 79.20 | 87.72 | 91.42 |
| TLOB | 81.55 | 82.68 | 90.03 | 92.81 |
Полная модель с обоими механизмами внимания стабильно лучше обеих усечённых версий на всех горизонтах: двойное внимание учит комплементарную информацию.
8. Заключение
Предложены MLPLOB и TLOB для прогноза тренда по LOB. Обе превзошли SoTA на FI-2010, NASDAQ (Tesla, Intel) и Bitcoin, особенно на длинных горизонтах. Определение порога тренда через средний спред (транзакционные издержки) существенно влияет на метрики и потенциальную прибыльность — разрыв между ML-метриками и торговой применимостью.
Будущая работа: scaling laws финансовых DL-моделей; более робастные подходы к растущей эффективности рынка; альтернативные определения тренда, лучше согласованные с торговыми ограничениями; обширный анализ прибыльности через бэктест или продвинутые симуляции рынка [10, 11, 2].
Ограничения. Методологии недостаточно зрелы для живой торговли. Порог по спреду сильно меняет оценку и потенциальную прибыль.
Риски. Автоматизированные ML-модели, встраиваемые в рынки, несут риски финансовой стабильности: могут усиливать системные уязвимости, запускать быстрые массовые реакции, повышать волатильность и вести к каскадным сбоям.
Приложения
A. Поиск гиперпараметров
Сеточный поиск — Таблица 10. Для DeepLOB и BiNCTABL использованы параметры [31] после большого поиска. При длине последовательности больше 128 качество выходит на плато. Число голов внимания TLOB: разницы между 1, 2 и 4 не было, фиксируем 1.
| Гиперпараметр | Пространство | TLOB | MLPLOB |
|---|---|---|---|
| Оптимизатор | {Adam [15], Lion [9]} | Adam | Adam |
| Длина последовательности | {64, 128, 256, 384, 512} | 128 | 384 |
| Learning rate | {0.001, 0.0003, 0.0001} | 0.0001 | 0.003 |
| Число слоёв | {2, 3, 4, 6} | 4 | 3 |
B. Дополнительные результаты
Кривые precision–recall для INTC и TSLA при горизонте 100 — Рис. 3 и 4. TLOB и MLPLOB стабильно дают более высокую точность на всех уровнях полноты. На INTC — отличная точность при низком полноте (уверенные положительные примеры). На FI-2010 точность остаётся высокой и при высоком полноте.
Литература
- Aiolfi, M. and Favero, C. A. (2005). Model uncertainty, thick modelling and the predictability of stock returns. Journal of Forecasting, 24(4):233–254. ↑
- Berti, L., Prenkaj, B. and Velardi, P. (2025). TRADES: Generating realistic market simulations with diffusion models. arXiv:2502.07071. ↑
- Bossaerts, P. and Hillion, P. (1999). Implementing statistical criteria to select return forecasting models. Review of Financial Studies, 12(2):405–428. ↑
- Bouchaud, J., Bonart, J., Donier, J. and Gould, M. (2018). Trades, Quotes and Prices. Cambridge University Press. ↑
- Bouchaud, J.-P., Mézard, M. and Potters, M. (2002). Statistical properties of stock order books. Quantitative Finance, 2(4):251. ↑
- Bouchaud, J.-P., Farmer, J. D. and Lillo, F. (2009). How markets slowly digest changes in supply and demand. In Handbook of Financial Markets, Elsevier. ↑
- Brown, T. B. (2020). Language models are few-shot learners. arXiv:2005.14165. ↑
- Byrd, D., Hybinette, M. and Balch, T. H. (2020). ABIDES: Towards high-fidelity multi-agent market simulation. PADS. ↑
- Chen, X. et al. (2024). Symbolic discovery of optimization algorithms. NeurIPS, 36. ↑
- Coletta, A. et al. (2021). Towards realistic market simulations: a GAN approach. ICAIF. ↑
- Coletta, A. et al. (2022). Learning to simulate realistic limit order book markets. ICAIF. ↑
- Cont, R. (2001). Empirical properties of asset returns. Quantitative Finance, 1(2):223. ↑
- Cont, R. (2011). Statistical modeling of high-frequency financial data. IEEE Signal Processing Magazine, 28(5):16–25. ↑
- Cont, R., Kukanov, A. and Stoikov, S. (2014). The price impact of order book events. Journal of Financial Econometrics, 12(1):47–88. ↑
- Kingma, D. P. and Ba, J. (2014). Adam: A method for stochastic optimization. ↑
- Dimson, E. and Marsh, P. (1999). Murphy’s law and market anomalies. Journal of Portfolio Management, 25(2):53–69. ↑
- Gould, M. D. et al. (2013). Limit order books. Quantitative Finance, 13(11):1709–1742. ↑
- Guo, Y. and Chen, X. (2023). Forecasting mid-price movements with high-frequency LOB. Arabian Journal for Science and Engineering, 48(8):9597–9618. ↑
- Hendrycks, D. and Gimpel, K. (2016). Gaussian error linear units (GELUs). arXiv:1606.08415. ↑
- Kaplan, J. et al. (2020). Scaling laws for neural language models. arXiv:2001.08361. ↑
- Kisiel, D. and Gorse, D. (2022). Axial-LOB: High-frequency trading with axial attention. IEEE SSCI. ↑
- Kissell, R. (2020). Algorithmic Trading Methods. Academic Press. ↑
- Nagel, S. (2021). Machine Learning in Asset Pricing. Princeton University Press. ↑
- Ntakaris, A. et al. Benchmark dataset for mid-price forecasting of LOB data. ↑
- Passalis, N. et al. (2019). Deep adaptive input normalization for time series forecasting. IEEE TNNLS, 31(9):3760–3765. ↑
- Prata, M. et al. (2024). LOB-based deep learning models for stock price trend prediction: a benchmark study. Artificial Intelligence Review, 57(5):1–45. ↑
- Sirignano, J. and Cont, R. (2021). Universal features of price formation. In Machine Learning and AI in Finance. ↑
- Sirignano, J. A. (2019). Deep learning for limit order books. Quantitative Finance, 19(4):549–570. ↑
- Tolstikhin, I. O. et al. (2021). MLP-Mixer: An all-MLP architecture for vision. NeurIPS, 34. ↑
- Tran, D. T. et al. (2018). Temporal attention-augmented bilinear network. IEEE TNNLS, 30(5):1407–1418. ↑
- Tran, D. T. et al. (2021). Data normalization for bilinear structures in HFT time-series. ICPR. ↑
- Tsantekidis, A. et al. (2017). Forecasting stock prices from the LOB using CNNs. CBI. ↑
- Tsantekidis, A. et al. (2017). Using deep learning to detect price change indications. EUSIPCO. ↑
- Tsantekidis, A. et al. (2020). Using deep learning for price prediction by exploiting stationary LOB features. Applied Soft Computing, 93:106401. ↑
- Vaswani, A. et al. (2017). Attention is all you need. NeurIPS, 30. ↑
- Wen, Q. et al. (2022). Transformers in time series: A survey. arXiv:2202.07125. ↑
- Zeng, A. et al. (2023). Are transformers effective for time series forecasting? AAAI, 37. ↑
- Zhang, Z. and Zohren, S. (2021). Multi-horizon forecasting for limit order books. arXiv:2105.10430. ↑
- Zhang, Z., Zohren, S. and Roberts, S. (2019). DeepLOB: Deep convolutional neural networks for limit order books. IEEE TSP, 67(11):3001–3012. ↑
Перевод выполнен с сохранением структуры, формул и таблиц оригинала. Оригинал: arXiv:2502.15757 · код: GitHub · Berti, Kasneci · CC BY-NC-SA 4.0.