LOB-Bench: бенчмарк генеративного ИИ для финансов — применение к данным книги лимитных заявок

9/10

Пир Надь*, Саша Фрей*, Кан Ли, Бидипта Саркар, Свитлана Вьетренко, Стефан Цорен, Анисоара Калинеску, Якоб Фёрстер · University of Oxford, J.P. Morgan AI Research · 16 июня 2025 (v2)

* равный вклад. Переписка: Peer Nagy, peer.nagy@eng.ox.ac.uk.

Оригинал: Nagy, P., Frey, S., Li, K., Sarkar, B., Vyetrenko, S., Zohren, S., Calinescu, A., Foerster, J. «LOB-Bench: Benchmarking Generative AI for Finance — an Application to Limit Order Book Data», 2025 — arxiv.org/abs/2502.09172 (PDF), лицензия CC BY 4.0. Код и сгенерированные данные: lobbench.github.io.

Рисунки воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY 4.0.

Аннотация

Финансовые данные — одна из самых трудных и интересных задач моделирования последовательностей: высокий шум, тяжёлые хвосты, стратегические взаимодействия агентов. Прогресс здесь тормозит отсутствие согласия по количественным парадигмам оценки. Мы предлагаем LOB-Bench — реализованный на Python бенчмарк качества и реалистичности генеративных message-by-order данных книги лимитных заявок (LOB) в формате LOBSTER. Каркас измеряет дистрибуционные различия условных и безусловных статистик между сгенерированными и реальными данными и допускает гибкую многомерную статистическую оценку. В бенчмарк входят привычные статистики LOB — спред, объёмы книги, дисбаланс заявок, интервалы между сообщениями — а также оценки обученной сети-дискриминатора. Наконец, LOB-Bench содержит «метрики рыночного воздействия»: кросс-корреляции и функции ценового отклика на конкретные события. Мы сравниваем генеративные авторегрессионные state-space модели, (C)GAN и параметрическую модель стакана и находим, что авторегрессионный GenAI-подход превосходит традиционные классы моделей. Код и сгенерированные данные: https://lobbench.github.io/.

1. Введение

Практики давно интересуются качественными синтетическими финансовыми данными. В высокочастотной области это особенно трудно из-за шума, тяжёлых хвостов и многоагентных взаимодействий. Генеративный ИИ сейчас меняет разные поля — от NLP до генерации изображений и прикладных задач. Поразительно, но каркас этих методов прост: самообучение на больших наборах с функцией потерь next-token prediction на авторегрессионных моделях последовательностей (Nie et al., 2024; Dubey et al., 2024; Liu et al., 2024).

Недавно Nagy et al. (2023) применили этот подход к книгам лимитных заявок — механизму, которым биржи учитывают заявки на покупку и продажу и в любой момент определяют цену. В отличие от предшествующих работ, моделировавших только агрегатные признаки (Cont et al., 2010; Coletta et al., 2022; Byrd et al., 2020), этот метод учит распределение на уровне токенов по сообщениям датасета LOBSTER (Huang, Polak, 2011).

Точная низкоуровневая генеративная модель финансовой системы ценна и с общественной, и с коммерческой точки зрения: она открывает лучший дизайн механизмов, анализ устойчивости и обучаемые алгоритмы (например, исполнение заявок, Frey et al., 2023) за счёт контрфактуалов.

Ключевой вопрос — как измерить реалистичность и доверие к GenAI и другим генеративным финансовым моделям. Для высокоуровневых подходов и «классического» агентного моделирования (Byrd et al., 2020; Chiarella, Iori, 2002; Paulin, 2019; Llacay, Peffer, 2018) оценка обычно качественная: воспроизводит ли модель известные стилизованные факты из литературы, «импакт» или знаменитый «закон квадратного корня» (Tóth et al., 2016; Brokmann et al., 2015; Almgren et al., 2005b). Большинство таких метрик неквантифицируемы и могут быть оторваны от ground-truth данных.

С другой стороны, стандартная оценка предобучения GenAI — просто кросс-энтропия: насколько модель предсказывает следующий токен на отложенных данных. Это не отражает поведение при авторегрессионном сэмплировании, когда последовательность генерируется по одному токену и накопление ошибок вызывает сдвиг распределения. Во многих приложениях это не проблема: предобученные модели — лишь стартовая точка для дообучения под задачу (например, RLHF), а не «голый» генератор. Мы же хотим оценивать предобученные модели именно в режиме сэмплирования, чтобы открыть перечисленные применения.

Поэтому мы предлагаем общий каркас оценки сходства распределения, индуцированного генеративными LOB-моделями, с истинными данными. На высоком уровне безусловная оценка состоит из трёх шагов. Сначала вводится набор функций-агрегаторов $\Phi$, отображающих высокоразмерный временной ряд LOB в набор одномерных подпространств. Затем по гистограммам оцениваются распределения истинных и сгенерированных данных в этих подпространствах и, наконец, различия сравниваются метрикой расстояния, например $L_1$. Часть агрегаторов близка к метрикам литературы (Vyetrenko et al., 2021; Paulin, 2019; Chiarella, Iori, 2002; Cont, 2001). Они же напрямую связаны с GAN (Goodfellow et al., 2014): сеть-дискриминатор эквивалентна наихудшему агрегатору для данного генератора.

Схема методологии LOB-Bench
Рис. 1. Схема методологии LOB-Bench для условной дистрибуционной оценки: скоринговая функция $\Phi$ проецирует высокоразмерную последовательность LOB в одно измерение; распределения реальных ($p_{b_j}$) и сгенерированных ($\hat p_{b_j}$) данных сравниваются расстоянием $\mathbb{D}$; итоговый условный скор — взвешенная сумма по корзинам.

Для условной дистрибуционной оценки сначала применяется агрегатор, результаты группируются в «корзины» по обусловливающей переменной, затем каждое условное распределение оценивается описанным выше процессом. Так можно, например, проверить, совпадает ли распределение bid-ask спреда, обусловленное временем дня, с соответствующим условным распределением реальных данных. Скалярная метрика — среднее потерь по корзинам, взвешенное вероятностью корзины. Тем же приёмом оценивается «дрейф модели»: агрегация по шагу сэмплирования и сравнение с безусловными данными — хороший прокси схода модели с рельсов при open-loop сэмплировании. Схема процесса — на рис. 1.

Каркас тестируется на пяти генеративных моделях: четыре современных GenAI (Coletta et al., 2022; Nagy et al., 2023; Peng et al., 2023; 2024) и широко используемая классическая модель как бейзлайн (Cont et al., 2010). Все модели — на данных акций Alphabet Inc. (GOOG) и Intel Corporation (INTC). Подробные результаты Coletta на INTC не приводим: архитектура разработана только для small-tick акций и на INTC ломается (Coletta et al., 2022). Мы находим свидетельства «схода модели»: дистанционные скоры растут при более длинных развёртках (рис. 5). Также LOBS5 лучше всех воспроизводит стандартные кривые ценового воздействия, хорошо известные в экономической и финансовой литературе (Eisler et al., 2012).

Вклады работы:

Мы надеемся, что бенчмарк даст необходимую точку отсчёта для оценки GenAI-моделей в финансах и позволит большему числу специалистов по ML строить новые модели последовательностей для этой важной и трудной области. Код и дополнительные материалы: https://lobbench.github.io/.

Схема книги лимитных заявок
Рис. 2. Схема LOB. Заявки, не исполняемые немедленно, встают в очереди FIFO на указанной лимитной цене. Лимитные заявки на продажу — на стороне ask (красное), на покупку — на стороне bid (синее).

2. Предпосылки

2.1. Книга лимитных заявок (LOB)

Дальнейшие разделы опираются на понимание механизмов электронных рынков, поэтому кратко напомним их. Публичные биржи вроде NASDAQ и NYSE обеспечивают покупку и продажу активов, принимая и удовлетворяя заявки множества участников. Биржа ведёт структуру данных — книгу заявок — по каждому торгуемому активу. LOB — снимок спроса и предложения в данный момент: электронная запись всех неисполненных лимитных заявок, организованных по ценовым уровням. Движок матчинга, обычно с приоритетом цена–время, спаривает входящий интерес покупки и продажи (Bouchaud et al., 2018). Типы заявок различают лимитные и рыночные. Лимитная заявка (рис. 2) задаёт цену, которую не следует превышать при покупке (bid) и ниже которой не следует опускаться при продаже (ask). Она ставит покоящуюся заявку в книгу на соответствующей стороне. Рыночная заявка означает готовность принять лучшую доступную цену немедленно.

В живой торговле вставка заявок вызывает активность других участников, обычно уводящую цены от агента. Это рыночное воздействие, market impact (Almgren, Chriss, 1999; Almgren et al., 2005a). Наличие импакта в реальном времени означает, что реалистичная симуляция торговой стратегии должна отклоняться от исторической траектории. Поэтому эмуляция реалистичного импакта — важное требование к моделированию стакана.

2.2. Модели LOB

Симуляция стакана — важный инструмент оценки торговых стратегий и проверки контрфактуальных рыночных сценариев. Насколько результатам таких симуляций можно доверять, зависит от точности эмуляции реального мира. Традиционно исторические данные используют для обучения и бэктеста стратегии, предполагая пренебрежимый импакт. Это опирается на малый размер заявок агента и достаточный интервал между сделками (Spooner et al., 2018). Допущение «нет импакта» неверно при больших размерах или высокой частоте заявок. Агентные методы естественно позволяют изучать такие явления, возникающие из взаимодействия многих участников и трудно моделируемые иначе. Однако они печально известны трудностью калибровки (Vyetrenko et al., 2021; Paulin, 2019). Чтобы обойти калибровку, условные GAN использовали для обучения симуляторов по историческим данным LOB, одновременно реалистичных и отзывчивых (Coletta et al., 2023). Недавно end-to-end авторегрессионная генеративная модель, производящая токенизированные сообщения LOB в духе GenAI, показала высокую степень реализма (Nagy et al., 2023).

2.3. Авторегрессионные модели LOB

В машинном обучении авторегрессия — ключевой компонент языковых моделей вроде GPT. Обучая распределение следующего токена при заданных предыдущих, авторегрессионные модели генерируют связный текст (Radford et al., 2019). Кросс-энтропия — обычная функция потерь классификации в глубоком обучении: она измеряет несходство предсказанных вероятностей классов с истинными метками (Goodfellow et al., 2016). Это отрицательное логарифмическое правдоподобие истинных меток при предсказанном распределении. Минимизация кросс-энтропии эквивалентна максимизации правдоподобия данных (Murphy, 2012). Кросс-энтропия по выборке размера $N$ с $V$ классами:

\[ L=-\frac{1}{N}\sum_{i=1}^{N}\sum_{v=1}^{V} y_i^{(v)}\log\hat y_i^{(v)}, \]

где $y_i^{(v)}=1$, если истинный класс равен $v$, и $0$ иначе, а $\hat y_i^{(v)}$ — предсказанная вероятность класса $v$. Кросс-энтропия сильно штрафует уверенные ошибки и побуждает модель выдавать калиброванные вероятности, совпадающие с эмпирическим распределением классов. Хотя она отличается от дивергенции KL, кросс-энтропию можно записать как сумму энтропии истинного распределения и KL между истинным и предсказанным (Cover, Thomas, 1999).

LOB играет центральную роль на современных финансовых рынках. С датасетом FI-2010 Ntakaris et al. (2018) выпустили первый публичный высокочастотный набор LOB для бенчмарка моделей прогноза mid-price. Этот предобработанный датасет содержит заявки по пяти акциям Nasdaq Nordic за десять последовательных дней. Он полезен для предварительных сравнений алгоритмов на стакане, но не позволяет всесторонне оценить устойчивость и обобщение (Zhang et al., 2019). Сходный бенчмарк прогноза средней цены и объёма на китайском рынке акций предложен Huang et al. (2021). Как и прочие доступные сейчас бенчмарки, эта работа не оценивает GenAI-модели в полностью дистрибуционной оптике. Cao et al. (2022) предлагают бенчмарк-датасет, комплементарный LOB-Bench: DSLOB — синтетический LOB, порождённый мультиагентной симуляцией с шоками, дающий размеченные in- и out-of-distribution выборки. Напротив, LOB-Bench не требует обучения на конкретном наборе и фокусируется на универсальной оценке и сравнении моделей.

Для оценки генеративных моделей в среде LOB ряд работ предложил релевантные метрики. Coletta et al. (2023) исследовали интерпретируемость, трудности и устойчивость условных генеративных моделей: группировали состояния книги по атрибутам и статистикам и затем выполняли условную генерацию по группам. Vyetrenko et al. (2021) предложили статистики реализма симуляторов LOB — интенсивность прихода заявок, распределение расстояний заявок, волатильность цены, — а Paulin (2019) дополнительно рассматривает лаговые автокорреляции и ликвидность сделок.

Итого: хотя оценка генеративных моделей стакана затрагивалась, единого бенчмарк-каркаса нет. Существующие работы часто качественно сравнивают статистические регулярности сгенерированных и реальных данных и не дают количественных метрик. Поэтому всесторонний каркас оценки генеративных LOB-моделей необходим для продвижения области.

4. Каркас оценки

Как показал успех LLM, генеративные модели уже могут достигать впечатляющего качества одним авторегрессионным обучением, или «предсказанием следующего токена». Однако не все классы моделей авторегрессионны и не все позволяют явно считать условные вероятности следующего токена — это запрещает оценку по кросс-энтропии или перплексии (Chen et al., 1998). Такие классы всё равно нужно оценивать, если из них можно хотя бы сэмплировать данные. Другая причина недостаточности однотокенной кросс-энтропии — так называемая «авторегрессионная ловушка» (Zhang et al., 2024). Даже малые ошибки next-token накапливаются на длинных последовательностях и уводят модель от обучающего распределения. Прогнозы вне распределения становятся всё хуже, пока порождающее распределение полностью не сойдёт с рельсов или не сколлапсирует. Это подчёркивает необходимость оценивать статистики по целым последовательностям, а не только кросс-энтропию. Каркас бенчмарка должен также измерять скорость накопления ошибок, оценивая распределения, обусловленные горизонтом прогноза.

Оценка генеративных моделей в любом домене — по сути сравнение распределений. Наш бенчмарк делает именно это. Он сводит высокоразмерное распределение последовательностей состояний книги $b\in B$ и событий-сообщений $m\in M$ к скалярам скоринговыми функциями $\Phi_i:(M\times B)\mapsto\mathbb{R}$, $i\in\mathbb{N}$. Одномерные распределения скоров затем сравниваются между реальными и модельными данными нормами или дивергенциями $D$. Оценивая различие безусловного реального распределения $p\{\Phi(d)\}$ и модельного $\hat p\{\Phi(d)\}$, то есть $D\bigl[p\{\Phi(d)\}\,\|\,\hat p\{\Phi(d)\}\bigr]$, модели можно ранжировать по способности воспроизводить признаки данных.

Чтобы оценить масштаб «авторегрессионной ловушки», бенчмарк считает расхождение ошибок распределений, обусловленное интервалом шага прогноза $t\in\mathbb{N}$, для границ интервала $a,b\in\mathbb{N}$:

\[ D\Bigl[p\{\Phi(d)\}\,\Big\|\,\hat p\bigl\{\Phi(d_{t\in[a,b)})\bigr\}\Bigr]. \]

Это позволяет квантифицировать сдвиг распределения во время инференса.

Каркас использует норму $L_1$ и расстояние Вассерштейна-1 как метрики потерь. Для оценки $L_1$ данные сначала бинируются. Как устойчивый алгоритм бинирования берётся правило Фридмана–Диакониса (Freedman, Diaconis, 1981): ширина бина $2\,\mathrm{IQR}\,n^{-1/3}$, где $n$ — суммарный размер выборки, IQR — межквартильный размах объединённых реальных и сгенерированных данных. Масштабированная на $[0,1]$ норма $L_1$, она же расстояние полной вариации, оценивается как

\[ \frac12\|p-\hat p\|_1=\sum_{b\in\mathrm{bins}}\frac12\left|p\Bigl(\frac{\mathrm{bcount}}{\mathrm{bwidth}}\Bigr)-\hat p\Bigl(\frac{\mathrm{bcount}}{\mathrm{bwidth}}\Bigr)\right|. \tag{1} \]

Преимущество $L_1$ — ограниченность отрезком $[0,1]$. Расстояние Вассерштейна-1, или earth mover’s distance (Rubner et al., 2000), чувствительно к расстоянию между скорами. Чтобы потери разных скоринговых функций были сравнимы, перед $W_1$ данные нормируют по среднему и дисперсии.

При равных размерах выборок $W_1$ считается так. Пусть $\Phi(d_{\mathrm{real}})^{(i)}$ — $i$-я порядковая статистика скора по реальной выборке из $p$, а $\Phi(d_{\mathrm{gen}})^{(i)}$ — по сгенерированным данным из $\hat p$. Тогда

\[ W_1(p,\hat p)=\sum_{i=1}^{n}\bigl|\Phi(d_{\mathrm{real}})^{(i)}-\Phi(d_{\mathrm{gen}})^{(i)}\bigr|_1. \tag{2} \]

Чтобы оценить способность модели подстраиваться под разные контексты, мы также оцениваем различия условных распределений скоров

\[ D\bigl[p\{\Phi_1(d)\mid\Phi_2(d)\}\,\|\,\hat p\{\Phi_1(d)\mid\Phi_2(d)\}\bigr]. \tag{3} \]

В этом случае $\Phi_2(d)$ бинируется в 10 децилей $b_j$ объединённых реальных и сгенерированных данных. Оценки расстояния по этим 10 условным распределениям взвешиваются средним оценённых плотностей обоих распределений. Полагая $X=\Phi_1(d)$ и $Y=\Phi_2(d)$, условная метрика:

\[ \sum_{b_j} D\bigl[p(X\mid Y\in b_j)\,\|\,\hat p(X\mid Y\in b_j)\bigr]\times\frac{p(Y\in b_j)+\hat p(Y\in b_j)}{2}. \tag{4} \]

Этот подход адресует конкретный тип сдвига распределения: вариацию скоров $\Phi_1$ вдоль распределения другого скора $\Phi_2$. Например, если $\Phi_2$ — среднее время сообщений внутри последовательности, каркас позволяет увидеть, как сдвиг распределения влияет на любой интересующий скор $\Phi_1$, и оценить, воспроизводит ли генеративная модель эту динамику.

Методология формализует и естественно расширяет обычные практики оценки синтетических одномерных рядов — например, финансовых доходностей, — где акцент на дистрибуционном сходстве. Каркас даёт количественную оценку дистрибуционных свойств структурированных высокоразмерных рядов. Меняя скоринговые функции, его можно применить к финансовым транзакциям, платёжным данным, потоковым котировкам FX, мультиактивным книгам заявок или децентрализованным криптопротоколам.

4.1. Функции отклика импакта

Главная трудность исторических данных LOB — невозможность оценить контрфактуалы: данные не реагируют на дополнительно вставленные заявки. Генеративные модели — уникальная возможность породить отклик на контрфактуальные сценарии и тем самым закрыть это ограничение.

Поэтому критично оценивать способность моделей давать реалистичный отклик на разные события. Как базовая методология берётся основополагающая работа Eisler et al. (2012) для сравнения воздействия разных типов событий. Метод фокусируется только на импакте событий, меняющих цену или количество лучших bid и ask (touch-заявки), что одновременно составляет его ключевое ограничение.

Все события, затрагивающие лучшие цены, классифицируются в один из шести типов $\pi\in\Pi$: рыночные заявки (MO), лимитные (LO) и отмены (CA), дополнительно разделённые на те, что меняют mid-цену (индекс $1$), и те, что не меняют (индекс $0$): $\Pi=\{MO_0,MO_1,LO_0,LO_1,CA_0,CA_1\}$.

По соглашению данных LOBSTER направление $\mathrm{dir}$ равно $1$ для событий на стороне bid и $-1$ на стороне ask. Событиям присваивается значение $\epsilon$ по ожидаемому направлению воздействия на mid-цену. В этом контексте исполнения считаются рыночными заявками:

\[ \epsilon=\begin{cases}\mathrm{dir}, & \text{если тип события — MO или LO},\\ -\mathrm{dir}, & \text{если тип события — CA}.\end{cases} \tag{5} \]

Это позволяет считать функцию отклика (6). Она оценивается эмпирически через среднее по времени $\langle\cdot\rangle_T$ изменения знаково скорректированной mid-цены $p_t=(a_t+b_t)/2$ после данного события при разных лагах $l$. Лаги событий берутся равномерно на логарифмической шкале между 1 и 200 тиками. Цены нормируются на размер тика, чтобы сравнивать разные акции:

\[ R_\pi(l)=\bigl\langle(p_{t+l}-p_t)\epsilon_t \bigm| \pi_t=\pi\bigr\rangle_T. \tag{6} \]

Eisler et al. (2012) идентифицируют усреднённые функции отклика для 14 случайных акций за 53 торговых дня. Такой анализ даёт хороший бейзлайн, с которым можно сравнивать результаты, но для оценки модели мы напрямую сравниваем функции между сгенерированными моделью и реальными последовательностями (сопоставленными по seed стартовой точки или по времени дня) для отдельных акций. После расчёта функций отклика строится мера несходства:

\[ \Delta R_\pi=\frac1L\sum_{l=1}^{L}\bigl|R_\pi^{\mathrm{real}}(l)-R_\pi^{\mathrm{gen}}(l)\bigr|, \tag{7} \]

которая агрегируется по всем типам событий средним $\Delta R=\frac1{|\Pi|}\sum_{\pi\in\Pi}\Delta R_\pi$.

4.2. Адверсариальная оценка

Идея адверсариальной оценки — предобученный дискриминатор, способный отличать истинные траектории от сгенерированных. Это бинарный классификатор, выдающий оценку вероятности того, что траектория реальна. На вход идут только состояния книги, последовательности сообщений игнорируются. Дискриминатор обучается на двух батчах размерности $(S\times T\times D)$: $S$ — число последовательностей в батче, $T$ — длина последовательностей книги, $D$ — размерность представления состояния.

Дискриминатор ищет «наихудшую» функцию $\Phi^*$, максимально разделяющую реальное и сгенерированное распределения: $\Phi^*=\arg\max_\Phi D[p(\Phi(d)),\hat p(\Phi(d))]$. Эту $\Phi^*$ можно интерпретировать как операцию снижения размерности последовательности состояний $b\in B$ к скаляру $s$, $\Phi^*:(M\times B)\mapsto\mathbb{R}$, — адверсариальную скоринговую функцию. Дискриминатор пытается найти самые явные изъяны и различия между реальными и сгенерированными выборками и сжать их в одно измерение.

Из-за разреженности изменений между соседними состояниями книги мы ввели схему кодирования, оптимизирующую работу дискриминатора. Состояние книги — цена и количество на верхних $n$ уровнях с обеих сторон. В экспериментах $n=10$, откуда $D=40$. Изменения состояния обычно вызваны событиями, затрагивающими одну пару цена–количество. Для более сжатого и информативного представления мы кодируем книгу через эти изменения. Состояния $b\in B$ и сообщения $m\in M$ отображаются в трёхмерные векторы функциями $\Psi_i:(M\times B)\mapsto\mathbb{R}^3$. Эти изменения охватывают сдвиг mid-цены, относительный ценовой уровень, где произошло изменение, и соответствующее изменение количества.

Дискриминатор использует одномерную свёрточную сеть Conv1D (Lecun, Bengio, 1995; Kiranyaz et al., 2019) как экстрактор признаков и затем механизм внимания (Vaswani et al., 2017) для длинных зависимостей по времени. Эмпирика: модель, обученная и протестированная на данных GOOG 2023, достигает ROC 0.83 — сгенерированные данные дискриминируются достаточно точно. У бейзлайна на GOOG и INTC ROC около 1 — запас для будущих улучшений велик. Высокая дискриминируемость может следовать из ошибок модели, на что указывают несовершенные скоры (разд. 6 и рис. 13 и далее). Дистрибуционное расхождение по одной скоринговой функции может быть достаточным, чтобы отличить подделку. Чтобы смягчить это, будущие работы могли бы оценивать адверсариальное качество, обучая дискриминатор на зашумлённых данных и сообщая скоры, обусловленные уровнем шума, особенно по мере улучшения моделей на этом бенчмарке.

4.3. Прогноз mid-цены

Чтобы оценить потенциальную пользу дополнительных синтетических данных, мы измеряем влияние добавленных обучающих данных на качество прогноза простой downstream-задачи. Конкретно адаптируем реализацию LOBCAST (Prata et al., 2024) и обучаем MLP на миллион параметров классифицировать движение mid-цены на разных горизонтах. MLP предсказывает три класса: вверх, вниз, стабильно. Следуя Prata et al. (2024), классы определяются движением mid-цены через пороговую величину. Для каждой оцениваемой генеративной модели обучаются два отдельных MLP: только на реальных данных и на смеси реальных и сгенерированных. F1 на отложенных реальных данных служит мерой влияния синтетики на обучение.

5. Пакет LOB-Bench

На основе каркаса раздела 4 мы разрабатываем Python-пакет, удобно и всесторонне оценивающий сгенерированные данные LOB. Бенчмарк легко настраивается: скоринговые функции $\Phi$ можно добавлять, убирать и менять; сравнение моделей стандартизировано набором функций по умолчанию. Пакет сообщает агрегатные скоры модели — среднее, медиану и межквартильное среднее (IQM, среднее значений между 25-м и 75-м процентилями) по всем условным и безусловным скоринговым функциям — вместе с бутстрэп-доверительными интервалами.

Паутинный график сравнения моделей
Рис. 3. Паутинный график сравнения моделей: LOBS5 обходит бейзлайн и Coletta почти по всем скорам. Радиальная ось инвертирована: рисуется отрицательная потеря (больше — лучше).

Бенчмарк выполняет и безусловную, и условную оценку сгенерированных данных, считая распределения статистик интереса условно на значение другой статистики. Чтобы измерить масштаб расхождения ошибок, или «снежного кома», распределения также оцениваются условно на горизонт прогноза. Дистрибуционная точность измеряется нормой $L_1$ и расстоянием Вассерштейна-1 между реальным и сгенерированным распределениями. Примеры более сложных условных распределений — функции отклика, описывающие распределение событий при условии, что другие события произошли на заданном лаге. Такие распределения обычно имеют высокую дисперсию; чтобы быть согласованными с литературой, мы вместо этого измеряем средние абсолютные различия их средних на диапазоне лагов — так оцениваются кривые рыночного воздействия.

Включены несколько условных скоринговых функций из финансовой литературы: объём ask условно на спред, спред условно на час дня, спред условно на волатильность 10-мс доходностей.

СтатистикаОписание
Bid-ask спредРазность между наивысшей ценой, которую готов платить покупатель (bid), и наименьшей, которую готов принять продавец (ask)
Дисбаланс книгиНа лучших ценах: $(\mathrm{bid\ size}-\mathrm{ask\ size})/(\mathrm{bid\ size}+\mathrm{ask\ size})$
Интервал между сообщениямиВремя между последовательными событиями книги (лог-шкала из-за длинного правого хвоста)
Время до отменыВремя от выставления до первой (частичной) отмены для отменённых лимиток, на лог-шкале
Объём bid/askОбъём всех заявок на стороне bid и ask; также объём только на лучших уровнях
Глубины лимиток и отменАбсолютное расстояние новых лимиток или отмен от mid-цены
Уровни лимиток и отменЦеновые уровни, на которых происходят события, $\in\mathbb{N}$
Объём в минутуПроторгованный объём в односекундных интервалах, масштабированный к минуте
Order Flow Imbalance (OFI)Метрика Cont et al. (2012): дисбаланс выставленных заявок в скользящем окне сообщений
OFI (Up/Stay/Down)OFI, обусловленный последующим движением mid-цены: вверх / без движения / вниз
Сводные скоры моделей
Рис. 4. Сводные скоры моделей (меньше — лучше). LOBS5 достигает наименьших общих скоров. Coletta обходит бейзлайн по Вассерштейну, но не по $L_1$. Усы — бутстрэп 99% ДИ.

Бенчмарк также оценивает функции отклика модели (6) в агрегате. Индивидуальные расстояния $L_1$ $\Delta R_\pi$ считаются для каждого лага и усредняются в агрегатные скоры импакта.

6. Результаты

Как первый тест-кейс мы адаптируем авторегрессионную state-space модель со слоями S5 (Gu et al., 2021) из Nagy et al. (2023) (LOBS5). В частности, масштабируем размер модели до 35 млн параметров и более чем удваиваем период обучения — весь 2022 год.

Также оцениваем данные моделей Cont et al. (2010) (бейзлайн), Coletta et al. (2022) (Coletta) и моделей на основе Peng et al. (2023; 2024) (RWKV 4 и 6). Бейзлайн с параметрическими процессами прихода адаптирован к динамике и small-tick, и large-tick книг: используются оценённые эмпирические интенсивности напрямую, без подгонки степенного закона. Дополнительно выводятся признаки, присутствующие в LOBSTER, — например индивидуальные ID сообщений, которые Cont et al. (2010) не генерируют. Это особенно важно для отмен: целевые лимитки равномерно сэмплируются из доступных заявок на указанном ценовом уровне. Для Coletta реализован интерфейс данных LOBSTER для конвертации форматов. Для моделей RWKV применяется авторегрессионное next-token prediction, но на более крупной модели (170 млн параметров), без предобработки данных и с готовым byte-pair токенизатором (Sennrich et al., 2016), как у LLM. Эти модели обучаются только на сообщениях, без книг, и не требуют продвижения рассчитанного состояния книги, в отличие от Nagy et al. (2023). Результаты S5, RWKV и бейзлайна, следуя Nagy et al. (2023), считаются для Alphabet (GOOG) и Intel (INTC) на подвыборке теста января 2023. Coletta обучается на трёх днях января 2019 и тестируется на трёх последующих, по процедуре Coletta et al. (2022) — из-за высокой вычислительной стоимости обучения и инференса. Сравнивая все модели, наблюдаем, что LOBS5 даёт state-of-the-art на задаче бенчмарка.

Модель Coletta обучалась и на GOOG, и на INTC, но не дала разумных результатов на INTC — ожидаемо, поскольку она рассчитана на small-tick акции, а INTC к ним не относится.

Рис. 3 — ключевая возможность бенчмарка: сравнить несколько моделей по нескольким измерениям скоров и увидеть индивидуальные сильные и слабые стороны. Сводные скоры на рис. 4: среднее, медиана и IQM метрик $L_1$ и Вассерштейна-1 по всем моделям. Усы отмечают 99% бутстрэп-ДИ. Метрики отдельных скоринговых функций — на рис. 12 (приложение E).

Результаты LOBS5: гистограммы и накопление ошибок
Рис. 5. Результаты LOBS5. Слева: сопоставление гистограмм безусловных распределений скоров реальных и сгенерированных данных. Справа: накопление ошибок — чем дальше горизонт прогноза, тем хуже качество модели; важная характеристика, которую стоит измерять.

Бенчмарк также измеряет расхождение ошибок, сравнивая распределения скоринговых функций условно на шаг инференса. Это показывает скорость, с которой распределения уходят от реальных данных. Ошибки растут у всех моделей; быстрее всего расходятся RWKV почти по всем скорам. Для модели S5 в особенности скоринговые функции, зависящие от признаков состояний книги, которые меняются лишь постепенно (например объём книги), ожидаемо расходятся по мере затухания начального реального seed. Однако скорость затухания всё равно можно сравнивать между моделями. Кривые расхождения $L_1$ — на рис. 18 в приложении E; обсуждение и абляция влияния размера бина на скоры расхождения — в приложении D.

L1-расстояние между гистограммами реальных и сгенерированных данных
Рис. 6. Расстояние $L_1$ между гистограммами реальных и сгенерированных данных (включая 99% ДИ). Бейзлайн хорош на скорах глубины и уровней книги и заметно хуже на временны́х и объёмных метриках. LOBS5 доминирует по потере $L_1$ на GOOG.

Функции отклика для Alphabet (GOOG) показаны на рис. 7 для бейзлайна и LOBS5. LOBS5 в целом воспроизводит кривые, близкие к реальным данным, и делает это лучше на small-tick акции GOOG. Напротив, бейзлайн (Cont et al., 2010) не может верно воспроизвести кривые импакта. Кривые импакта Coletta и RWKV не публикуем: они быстро расходятся из-за накопления ошибок на инференсе. Среднее расстояние $L_1$ между реальными и сгенерированными кривыми импакта (уравнение 7) равно $\Delta R=2.45$ для LOBS5 и $\Delta R=126$ для RWKV-6. У LOBS5 различия в основном по заявкам $MO$ на коротких лагах. Причина — симулятор JAX-LOB (Frey et al., 2023), которым LOBS5 пользуется на инференсе: JAX-LOB разбивает лимитки, которые можно исполнить лишь частично, на сообщения исполнения и дополнительные покоящиеся лимитки, тем самым сливая многоуровневый сдвиг mid-цены в одно обновление книги.

Функции отклика mid-цены для GOOG
Рис. 7. Сравнение нормированных на тик функций отклика mid-цены для разных типов событий между реальными и сгенерированными данными. Заштрихованные области — 99% ДИ. Сравниваются LOBS5 и стохастический бейзлайн. В отличие от бейзлайна, LOBS5 воспроизводит большинство черт ожидаемых функций отклика импакта.

F1 прогноза тренда mid-цены простым MLP по реализации LOBCAST (Prata et al., 2024) для Alphabet (GOOG) — на рис. 8. Наблюдаем, что у Coletta включение сгенерированных синтетических данных заметно снижает точность и полноту прогноза. Это согласуется с ранжированием моделей по дистрибуционным расстояниям на рис. 5. Тот же паттерн в целом присутствует и у остальных моделей, особенно на коротких горизонтах, хотя и менее экстремально. Смешивание сгенерированных данных бейзлайна или LOBS5 в обучающую выборку не даёт значимого эффекта на более длинных горизонтах. Хотя желательно, чтобы модели порождали данные, повышающие качество прогноза, как минимум они не должны вредить. Результаты показывают, что текущие генеративные модели ещё не умеют порождать данные, помогающие этой задаче прогноза тренда mid-цены. Дальнейшая дифференциация качества моделей по этой задаче ограничена. Напротив, дистрибуционная оценка LOB-Bench даёт более ясную картину сильных сторон моделей и потенциала улучшений.

F1 прогноза mid-цены на GOOG
Рис. 8. Сравнение F1 MLP-классификаторов, обученных только на исторических (реальных) данных (сплошные линии) и на смеси реальных и сгенерированных (пунктир), для подмножества генеративных моделей. Усы — 95% ДИ, бутстрэп по пяти seed обучения.

7. Заключение

Мы представляем LOB-Bench — каркас оценки генеративных ИИ-моделей книги заявок. Важно, что в каркасе есть инструменты анализа, которыми удобно пользоваться и специалистам по ML, и практикам финансов, чтобы бенчмаркать модели потока заявок на уровне сообщений.

Мы считаем, что LOB-Bench сильно облегчит исследователям ML, работающим с моделированием последовательностей, применение своих инноваций к этой трудной и релевантной реальной задаче — и одновременно упростит финансистам использование инструментов best practice.

Один из интересных аспектов генеративных ИИ-моделей микроструктурных данных — способность моделировать контрфактуалы, тесно связанная с понятием ценового воздействия. Учесть реакции других участников на свои действия обычными методами очень трудно, но наш набор тестов для генеративных LOB-моделей даёт обширные проверки того, воспроизводят ли сгенерированные данные ожидаемые функции отклика на более крупном масштабе. Будущие исследования могли бы измерять, насколько генеративные модели соответствуют законам рыночного воздействия из литературы, например «закону квадратного корня» (Tóth et al., 2016). Мы надеемся, что LOB-Bench откроет дверь многим новым работам, включая обучение алгоритмов с подкреплением и мультиагентных моделей для задач вроде исполнения сделок, с возможностью моделировать реалистичные реакции разных участников рынка.

Благодарности

Мы благодарим Oxford-Man Institute of Quantitative Finance и Foerster Lab for AI Research за доступ к GPU-серверам. Эти вычислительные ресурсы были необходимы для экспериментов и анализов этой работы. AC признаёт финансирование UKRI AI World Leading Researcher Fellowship (грант EP/W002949/1). AC и JF признают финансирование JPMC Faculty Research Award. Для целей Open Access авторы применили публичную лицензию CC BY к любой Author Accepted Manuscript версии, возникающей из этой подачи.

Заявление о воздействии

Эта статья представляет работу, цель которой — продвинуть область машинного обучения. У работы много потенциальных общественных последствий; ни одно из них, по мнению авторов, не требует отдельного выделения здесь.

Литература

  1. Almgren, R. and Chriss, N. (1999). Optimal execution of portfolio transactions. Journal of Risk.
  2. Almgren, R., Thum, C., Hauptmann, E., and Li, H. (2005a). Direct estimation of equity market impact. RISK, 18.
  3. Almgren, R., Thum, C., Hauptmann, E., and Li, H. (2005b). Direct Estimation of Equity Market Impact. Risk, 18(7):58–62.
  4. Bouchaud, J.-P., Bonart, J., Donier, J., and Gould, M. (2018). Trades, quotes and prices: financial markets under the microscope. Cambridge University Press.
  5. Brokmann, X., Sérié, E., Kockelkoren, J., and Bouchaud, J.-P. (2015). Slow Decay of Impact in Equity Markets. Market Microstructure and Liquidity, 01(02):1550007.
  6. Byrd, D., Hybinette, M., and Balch, T. H. (2020). Abides: Towards high-fidelity multi-agent market simulation. In Proc. ACM SIGSIM PADS, pp. 11–22.
  7. Cao, D., El-Laham, Y., Trinh, L., Vyetrenko, S., and Liu, Y. (2022). DSLOB: a synthetic limit order book dataset for benchmarking forecasting algorithms under distributional shift. arXiv:2211.11513.
  8. Chen, S. F., Beeferman, D., and Rosenfeld, R. (1998). Evaluation metrics for language models.
  9. Chiarella, C. and Iori, G. (2002). A simulation analysis of the microstructure of double auction markets. Quantitative Finance, 2(5):346–353.
  10. Coletta, A., Moulin, A., Vyetrenko, S., and Balch, T. (2022). Learning to simulate realistic limit order book markets from data as a world agent. In Proc. 3rd ACM ICAIF, pp. 428–436.
  11. Coletta, A., Jerome, J., Savani, R., and Vyetrenko, S. (2023). Conditional generators for limit order book environments: Explainability, challenges, and robustness. In Proc. 4th ACM ICAIF, pp. 27–35.
  12. Cont, R. (2001). Empirical properties of asset returns: stylized facts and statistical issues. Quantitative Finance, 1(2):223–236.
  13. Cont, R., Stoikov, S., and Talreja, R. (2010). A stochastic model for order book dynamics. Operations Research, 58(3):549–563.
  14. Cont, R., Kukanov, A., and Stoikov, S. (2012). The price impact of order book events. Journal of Financial Econometrics, 12(1):47–88.
  15. Cover, T. M. and Thomas, J. A. (1999). Elements of Information Theory. John Wiley & Sons.
  16. DeepMind et al. (2020). The DeepMind JAX Ecosystem. github.com/google-deepmind.
  17. Defazio, A. and Mishchenko, K. (2023). Learning-rate-free learning by D-Adaptation. ICML 2023.
  18. Dubey, A. et al. (2024). The Llama 3 Herd of Models. arXiv:2407.21783.
  19. Eisler, Z., Bouchaud, J.-P., and Kockelkoren, J. (2012). The price impact of order book events: market orders, limit orders and cancellations. Quantitative Finance, 12(9):1395–1419.
  20. Freedman, D. and Diaconis, P. (1981). On the histogram as a density estimator: $L_2$ theory. Zeitschrift für Wahrscheinlichkeitstheorie, 57(4):453–476.
  21. Frey, S., Li, K., Nagy, P., Sapora, S., Lu, C., Zohren, S., Foerster, J., and Calinescu, A. (2023). JAX-LOB: A GPU-accelerated limit order book simulator to unlock large-scale reinforcement learning for trading. In Proc. 4th ACM ICAIF.
  22. Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A., and Bengio, Y. (2014). Generative adversarial nets. NeurIPS, 27.
  23. Goodfellow, I., Bengio, Y., and Courville, A. (2016). Deep Learning. MIT Press.
  24. Gu, A., Goel, K., and Ré, C. (2021). Efficiently modeling long sequences with structured state spaces. ICLR.
  25. Huang, C., Ge, W., Chou, H., and Du, X. (2021). Benchmark dataset for short-term market prediction of limit order book in China markets. The Journal of Financial Data Science, 3(4):171–183.
  26. Huang, R. and Polak, T. (2011). LOBSTER: Limit order book reconstruction system. SSRN 1977207.
  27. Kingma, D. P. and Ba, J. (2014). Adam: A method for stochastic optimization. arXiv:1412.6980.
  28. Kiranyaz, S. et al. (2019). 1D Convolutional Neural Networks and Applications: A Survey. arXiv:1905.03554.
  29. Lecun, Y. and Bengio, Y. (1995). Convolutional networks for images, speech, and time-series. In The handbook of brain theory and neural networks. MIT Press.
  30. Liu, Y., Qin, G., Huang, X., Wang, J., and Long, M. (2024). AutoTimes: Autoregressive Time Series Forecasters via Large Language Models. arXiv:2402.02370.
  31. Llacay, B. and Peffer, G. (2018). Using realistic trading strategies in an agent-based stock market model. Computational and Mathematical Organization Theory, 24(3):308–350.
  32. Murphy, K. P. (2012). Machine learning: a probabilistic perspective. MIT Press.
  33. Nagy, P., Frey, S., Sapora, S., Li, K., Calinescu, A., Zohren, S., and Foerster, J. (2023). Generative AI for end-to-end limit order book modelling: A token-level autoregressive generative model of message flow using a deep state space network.
  34. Nie, Y. et al. (2024). A Survey of Large Language Models for Financial Applications: Progress, Prospects and Challenges. arXiv:2406.11903.
  35. Ntakaris, A., Magris, M., Kanniainen, J., Gabbouj, M., and Iosifidis, A. (2018). Benchmark dataset for mid-price forecasting of limit order book data with machine learning methods. Journal of Forecasting, 37(8):852–866.
  36. Pascanu, R., Mikolov, T., and Bengio, Y. (2013). On the difficulty of training recurrent neural networks. arXiv:1211.5063.
  37. Paulin, J. (2019). Understanding flash crash contagion and systemic risk: a calibrated agent-based approach. DPhil thesis, University of Oxford.
  38. Peng, B. et al. (2023). RWKV: Reinventing RNNs for the transformer era. arXiv:2305.13048.
  39. Peng, B. et al. (2024). Eagle and Finch: RWKV with matrix-valued states and dynamic recurrence. arXiv:2404.05892.
  40. Prata, M. et al. (2024). LOB-based deep learning models for stock price trend prediction: a benchmark study. Artificial Intelligence Review, 57(5):116.
  41. Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., and Sutskever, I. (2019). Language models are unsupervised multitask learners. OpenAI blog, 1(8):9.
  42. Rubner, Y., Tomasi, C., and Guibas, L. J. (2000). The earth mover’s distance as a metric for image retrieval. Int. J. Comput. Vis., 40(2):99–121.
  43. Sennrich, R., Haddow, B., and Birch, A. (2016). Neural machine translation of rare words with subword units. In Proc. ACL, pp. 1715–1725.
  44. Spooner, T., Fearnley, J., Savani, R., and Koukorinis, A. (2018). Market making via reinforcement learning. In Proc. AAMAS, pp. 434–442, Stockholm.
  45. Tóth, B., Eisler, Z., and Bouchaud, J.-P. (2016). The square-root impact law also holds for option markets. Wilmott, 2016(85):70–73.
  46. Vaswani, A. et al. (2017). Attention Is All You Need. arXiv:1706.03762.
  47. Vyetrenko, S. et al. (2021). Get real: realism metrics for robust limit order book market simulations. In Proc. 1st ACM ICAIF, pp. 1–8.
  48. Zhang, Z., Zohren, S., and Roberts, S. (2019). DeepLOB: Deep convolutional neural networks for limit order books. IEEE Trans. Signal Processing, 67(11):3001–3012.
  49. Zhang, Z., Zhang, Q., and Foerster, J. (2024). Parden, can you repeat that? Defending against jailbreaks via repetition. arXiv:2405.07932.

Приложения

A. Код бенчмарка

Код бенчмарка: github.com/peernagy/lob_bench; дополнительные материалы — на сайте проекта lobbench.github.io.

Набор даёт удобный API для оценки модельных данных по диапазону скоринговых функций и метрик. Спецификация функций и метрик потерь задаётся словарём конфигурации, который передаётся функции безусловной и условной оценки. Аналогично есть функции расчёта кривых рыночного воздействия вместе со средним скором $L_1$. Словарь конфигурации по умолчанию, задающий скоринговые функции этой статьи и оценивающий их потерями $L_1$ и Вассерштейна-1, прилагается для воспроизводимости.

Чтобы запустить бенчмарк, реальные и сгенерированные последовательности должны храниться в формате LOBSTER (описание структуры данных) как CSV. Файлы разделяются на реальные данные, сгенерированные и (реальные) данные, использованные для обусловливания генерации. Более подробное описание — на GitHub.

B. Детали обучения LOBS5

Кривые потерь LOBS5 на тесте
Рис. 9. Кривые потерь на тесте (данные 2023) для модели LOBS5: средняя по сообщениям отрицательная логарифмическая правдоподобность для INTC (зелёное) и GOOG (красное) на протяжении 100 эпох. Кросс-энтропия сообщения после 100 эпох: 19.14 для INTC и 17.80 для GOOG.

Отталкиваясь от модели Nagy et al. (2023), мы масштабировали размер, добавив слои S5; итоговое число параметров около 35 млн (исходно 6.3 млн). Обучение — 100 эпох перемешанных последовательностей за весь 2022 год, бюджет 30.4 L40-дней (3.8 дня на 8 GPU). Оптимизатор Adam (Kingma, Ba, 2014) с косинусным расписанием learning rate. Потери на тесте в ходе обучения — на рис. 9.

С более крупной моделью удалось также убрать явный механизм коррекции ошибок, который изначально отвергал семантически некорректные сгенерированные сообщения: частота ошибок достаточно снизилась за счёт масштаба модели.

C. Детали обучения RWKV

Кривые потерь RWKV
Рис. 10. Кривые потерь обучения моделей RWKV. Ось $y$ — средняя отрицательная логарифмическая правдоподобность обучаемых сообщений, сумма NLL каждого токена в сообщении. Жирные линии — экспоненциальное скользящее среднее истинной кривой (полупрозрачная) с $\alpha=0.1$, чтобы лучше видеть тренд.

Все модели RWKV обучались авторегрессионно только на данных сообщений (без информации о состоянии книги) с тем же протоколом фильтрации сообщений, что у Nagy et al. (2023). Каждый датасет LOBSTER токенизирован byte-pair encoder (Sennrich et al., 2016), обученным на сообщениях GOOG 2017: 5.5 млрд токенов для INTC 2022 (276 млн сообщений) и 7.5 млрд для GOOG 2022 (380 млн сообщений). Датасеты делятся на чанки по 16 384 токена, чанки случайно перемешиваются. Параметры инициализируются из открытых предобученных базовых RWKV (по 170 млн параметров); обучение — 8 чанков на шаг оптимизации, оптимизатор DAdapt-AdamW (Defazio, Mishchenko, 2023) в Optax (DeepMind et al., 2020), без масштабирования learning rate и без планировщиков. Для устойчивости глобальная норма градиента клипится до 1.0 (Pascanu et al., 2013). Обучение всех четырёх моделей RWKV (2 архитектуры × 2 датасета) заняло 10 L40S-дней. Кривые потерь — на рис. 10.

D. Чувствительность метрик расхождения к размеру бина

Мы принимаем динамический размер бина по правилу Фридмана–Диакониса (FD), специально приспособленному к распределению данных, и потому не ожидаем сильной чувствительности к выбору размера. Это подкреплено теоретическим свойством сходимости: правило FD минимизирует интегральную среднеквадратичную ошибку (IMSE) между гистограммой и истинным распределением (Freedman, Diaconis, 1981).

Чтобы эмпирически оценить влияние размера бина на сообщаемые скоры расхождения, те же вычисления повторяются с половиной и с удвоенным обычным размером бина — для модели LOBS5 по всем оцениваемым метрикам. Меньшие бины склонны увеличивать ошибки $L_1$ и Вассерштейна-1: точки, которые попали бы в один бин, могут оказаться в двух. Напротив, большие бины склонны уменьшать ошибки: близкие точки чаще группируются вместе, аппроксимация становится глаже.

Чувствительность L1 к размеру бина
Рис. 11. Скоры расхождения $L_1$ при половине и удвоении обычного размера бина. Большие отклонения размера (уполовинивание или удвоение) систематически влияют на уровень скоров, но не на ранжирование.

Рис. 11 показывает средние скоры расхождения LOBS5 вместе с 99% ДИ. Удвоение или уполовинивание бина даёт согласованное снижение или рост ошибок соответственно. Величина этих отклонений сравнима с шириной доверительных интервалов при размере бина FD по умолчанию. Поскольку изменения относительно малы и систематичны, мы заключаем: хотя теоретически обоснованное правило бинирования важно, ранжирование моделей устойчиво, пока одна и та же стратегия бинирования применяется ко всем оцениваемым моделям единообразно.

E. Дополнительные рисунки

L1 и Вассерштейн по GOOG и INTC
Рис. 12. Ошибки $L_1$ и Вассерштейна-1 сгенерированных безусловных распределений для удобного сравнения Alphabet (GOOG) и Intel (INTC). Усы — 99% бутстрэп-ДИ.
Гистограммы скоров LOBS5
Рис. 13. LOBS5 — гистограммы распределений скоров реальных (синее) и сгенерированных (оранжевое) данных LOB для Alphabet (GOOG) и Intel (INTC). В целом адаптированная из Nagy et al. (2023) генеративная модель хорошо совпадает с данными по многим измерениям. Большие ошибки видны, например, по спреду (GOOG), дисбалансу книги (INTC) и времени до отмены (GOOG и INTC).
Гистограммы скоров бейзлайна
Рис. 14. Бейзлайн — гистограммы распределений скоров для GOOG и INTC. Модель Cont et al. (2010) прилично совпадает с частью скоров, особенно дискретными — глубинами и уровнями. Явные слабости — дисбаланс книги и объёмы.
Гистограммы скоров RWKV-4
Рис. 15. RWKV-4 — гистограммы распределений скоров для GOOG и INTC. Модель порождает волатильные данные с более широкими спредами, пропускает корректные уровни заявок, из-за чего трудно совпасть с объёмами книги.
Гистограммы скоров RWKV-6
Рис. 16. RWKV-6 — гистограммы распределений скоров для GOOG и INTC. Сходные слабости с RWKV-4 (неверные ценовые уровни, несовпадение объёмов книги и т.д.) из-за токенизации сырых данных и отсутствия информации о книге.
Гистограммы скоров Coletta на GOOG
Рис. 17. Coletta — гистограммы распределений скоров реальных (синее) и сгенерированных (оранжевое) данных LOB для Alphabet (GOOG).
Расхождение L1 по горизонту
Рис. 18. Расхождение ошибки $L_1$: сравнение $L_1$-ошибок распределений скоров реальных данных со сгенерированными на заданном горизонте в будущее показывает накопление ошибок модели. Это объясняется снежным комом ошибок teacher forcing (условная потеря следующего токена). Хорошая модель должна контролировать ошибки на как можно более длинных последовательностях. Пунктир — 99-й процентиль ошибки $L_1$ между бутстрэп-выборками только реальных данных, порог значимости над чистым шумом сэмплирования.
Условные распределения спреда
Рис. 19. Гистограммы условных распределений скоров реальных (синее) и сгенерированных (оранжевое) данных для Alphabet (GOOG). (a) Bid-ask спред условно на час дня: спреды выше рано утром; сгенерированные данные также дают слишком узкие спреды. (b) Спред условно на волатильность: более высокая волатильность соответствует большей частоте широких спредов. Модель не полностью улавливает этот сдвиг — расхождение в бинах высокой волатильности выше. Веса $w$ — доля данных в бине, вклад данной условной строки в суммарную потерю метрики.
Объём книги условно на спред
Рис. 20. Гистограммы полного объёма книги условно на bid-ask спред для Alphabet (GOOG). Веса $w$ — доля данных в бине, вклад строки в суммарную потерю.
ROC-кривая дискриминатора LOBS5
Рис. 21. LOBS5 — ROC-кривая дискриминатора на тесте (GOOG). Дискриминатор представляет наихудшую адверсариальную скоринговую функцию, обучаясь отличать реальные последовательности состояний LOB от сгенерированных.
Гистограмма логитов дискриминатора
Рис. 22. LOBS5 — гистограмма логит-скоров реальных и сгенерированных последовательностей на отложенном тесте (GOOG). Хорошее совпадение этих распределений указывало бы на высокое качество модели: даже обученная сеть-дискриминатор не смогла бы их различить.
Функции отклика импакта для INTC
Рис. 23. Сравнение функций отклика импакта разных типов событий между реальными и сгенерированными данными, нормированный на тик отклик mid-цены, для Intel (INTC). Заштрихованные области — 99% ДИ. Сравниваются LOBS5 и стохастический бейзлайн. В отличие от бейзлайна, генеративная модель воспроизводит гораздо больше ожидаемой функции импакта, хотя и хуже, чем на GOOG.

Перевод выполнен с сохранением структуры, формул и данных оригинала. Оригинал: arXiv:2502.09172 · Nagy, Frey, Li, Sarkar, Vyetrenko, Zohren, Calinescu, Foerster · CC BY 4.0.