Рисуя рынок: генеративные диффузионные модели для симуляции и прогноза лимитного стакана
Альфред Бэкхаус, Кан Ли, Якоб Фёрстер, Анишоара Калинеску, Стефан Зорен · Оксфордский университет (департаменты информатики, статистики, инженерных наук; Foerster Lab for AI Research) · 5 сентября 2025
Оригинал: Backhouse, A., Li, K., Foerster, J., Calinescu, A., Zohren, S. «Painting the market: generative diffusion models for financial limit order book simulation and forecasting», 2025 — arxiv.org/abs/2509.05107 (PDF).
Рисунки воспроизведены из оригинальной публикации. Оригинал распространяется по стандартной лицензии arXiv (non-exclusive distribution), которая производных произведений не разрешает: все права на оригинальный текст принадлежат авторам, перевод выполнен для личного ознакомления с указанием источника.
Аннотация
Симуляция лимитных стаканов (LOB) имеет важные применения в прогнозировании и тестировании на исторических данных финансовых рынков. Однако глубокие генеративные модели испытывают здесь трудности из-за высокого уровня шума и сложности данных. Предшествующие работы используют авторегрессионные модели, но те страдают от накопления ошибки на длинных последовательностях. Мы предлагаем новый подход: преобразуем данные стакана в структурированный формат изображения и применяем диффузионные модели с дорисовкой (inpainting) для генерации будущих состояний стакана. Метод использует пространственно-временны́е индуктивные смещения, присущие стакану, и позволяет генерировать длинные последовательности параллельно, преодолевая проблему накопления ошибки.
Мы также вносим публичный вклад в LOB-Bench, отраслевой бенчмарк для генеративных моделей стакана, чтобы обеспечить честное сравнение моделей, использующих данные уровня 2 и уровня 3 (без сообщений и с сообщениями соответственно). Мы показываем, что наша модель достигает наилучших результатов на LOB-Bench, несмотря на использование данных меньшей информативности. Мы также показываем, что наш метод отдаёт приоритет когерентным глобальным структурам перед локальными деталями высокой точности, что даёт значительные улучшения по ряду метрик. В целом наша работа закладывает прочную основу для дальнейших исследований генеративных диффузионных подходов к моделированию стакана.
1. Введение
В последнее время глубокие генеративные модели — большие языковые и диффузионные — демонстрируют прогресс в целом ряде областей. Публичный прогресс в финансовой области ограничен из-за закрытости исследований, а также сложности и зашумлённости данных. Точная симуляция финансовых рынков имеет несколько полезных применений: прогноз будущих движений рынка, тестирование контрфактического воздействия для проверки торговых идей, создание реалистичных сред обучения с подкреплением для тренировки агентов и выявление неожиданных рыночных исходов. Поэтому генеративное моделирование финансовых данных — ценная и недостаточно исследованная область.
Данные лимитного стакана описывают полное состояние книги заявок — открытые заявки на покупку и продажу — с указанием доступного объёма на каждом ценовом уровне. Данные уровня 3 включают также каждое сообщение, отправленное на биржу, — новые заявки или снятия. Предшествующие работы применяют традиционные методы: линейные модели, свёрточные нейросети или генеративно-состязательные сети. Более поздние работы применяют авторегрессионные последовательностные модели. Стандартный отраслевой бенчмарк LOB-Bench позволяет оценивать различные генеративные модели стакана по ряду метрик.
Диффузионные модели показали сильные результаты в генерации изображений благодаря способности использовать пространственные индуктивные смещения данных. Предшествующие работы по стаканам трактуют книгу заявок как двумерное изображение, соответствующее ценовым уровням и объёмам во времени, пользуясь иерархическими пространственными признаками. Мы объединяем эти идеи: преобразуем истории стакана в собственный, улучшенный формат изображения и применяем диффузионные модели. Мы сравниваем результат с моделями уровня state-of-the-art на бенчмарке LOB-Bench и обнаруживаем, что наш метод достигает конкурентной результативности по потере $L_1$ и наилучшей — по потере Вассерштейна. Метод также обеспечивает более быстрый вывод для длинных последовательностей.
Основные вклады работы:
- улучшенный способ представления стакана как изображения, лучше отражающий структуру данных за счёт более удачной компоновки;
- новый подход к генеративному моделированию стакана с помощью диффузии и дорисовки на новом представлении;
- публичный вклад в отраслевой бенчмарк LOB-Bench, позволяющий честно сравнивать методы на основе уровня 2 (только книга) и уровня 3 (книга и сообщения);
- тщательная оценка метода, включая исследование его сильных и слабых сторон через абляции по скорости сэмплирования и устойчивости.
2. Предварительные сведения
2.1. Лимитные стаканы
Лимитный стакан — доминирующая микроструктура торговли на современных электронных финансовых рынках. Он работает в непрерывном времени, позволяя участникам подавать заявки на покупку и продажу по любой цене и любого размера. Это непрерывный двойной аукцион: когда заявки на покупку и продажу пересекаются — цена покупки выше цены продажи, — они исполняются на максимальный доступный объём. Заявки сопоставляются по приоритету «цена — время»: заявки с более конкурентной ценой (выше для покупок, ниже для продаж) исполняются первыми, а при равной цене приоритет имеет поданная раньше. Лимитные заявки, задающие размер и ценовой предел, лежат в книге до исполнения или снятия, и стакан состоит из таких неисполненных заявок. Все сообщения анонимизированы и видны всем участникам сразу при подаче. Данные уровня 2 состоят только из состояний книги на каждом шаге, тогда как уровень 3 включает ещё и каждое отдельное сообщение.
2.2. Диффузия
Генеративные модели выучивают распределение данных и способны сэмплировать и порождать новые, похожие данные. Диффузионные модели показали особую пригодность в генерации изображений и видео. Распространённый каркас — вероятностные диффузионные модели с шумоподавлением (DDPM): прямой процесс диффузии добавляет гауссовский шум к образцам данных на протяжении $T$ шагов так, что после последнего шага образец есть чистый гауссовский шум. Это позволяет получать частично зашумлённые образцы, используемые при обучении. На каждом шаге добавляется небольшое количество шума:
$$q(\mathbf{x}_t \mid \mathbf{x}_{t-1}) = \mathcal{N}\left(\mathbf{x}_t;\ \sqrt{1 - \beta_t}\,\mathbf{x}_{t-1},\ \beta_t \mathbf{I}\right)$$
где $\beta_t \in (0, 1)$ управляет расписанием дисперсии.
Важно, что зашумлённые данные на любом шаге можно эффективно сэмплировать по замкнутой маргинали $q(\mathbf{x}_t \mid \mathbf{x}_0)$. В обратном процессе диффузии цель модели — выучить обратное условное распределение, что эквивалентно предсказанию изображения с удалённым одним шагом шума:
$$p_\theta(\mathbf{x}_{t-1} \mid \mathbf{x}_t) = \mathcal{N}\left(\mathbf{x}_{t-1};\ \boldsymbol{\mu}_\theta(\mathbf{x}_t, t),\ \sigma_t^2 \mathbf{I}\right)$$
В итоге модель может стартовать с чистого шума и постепенно порождать новые изображения. На практике модель предсказывает шум в момент $t$, $\boldsymbol{\epsilon}_\theta$, а не предыдущее изображение напрямую. При обучении мы берём изображение из обучающей выборки, добавляем случайное количество шума и предсказываем добавленный шум. При выводе модель начинает с полностью зашумлённого изображения $x_T$ и последовательно выполняет полный обратный процесс, повторно предсказывая шум и удаляя его, пока не получится $x_0$. Хотя метод изложен применительно к изображениям, процесс диффузии применим к любым непрерывным данным.
2.3. Дорисовка
При дорисовке на вход модели подаётся изображение с зашумлённой областью, и модель учится очищать изображение целиком, используя незашумлённые области как контекст для восстановления зашумлённой. Этот механизм хорошо согласуется с задачей стакана, где у нас есть история в естественной структуре изображения и мы хотим «дорисовать» будущее, гладко продолжающее изображение в том же формате.
3. Связанные работы
3.1. Генеративное моделирование стакана
Традиционные методы используют генеративно-состязательные сети или LSTM. Позднее применяется авторегрессионная модель на уровне токенов, построенная на архитектуре пространства состояний S5; те же авторы предоставляют LOB-Bench — обширный набор инструментов для сравнения генеративных моделей стакана. MARS даёт движок рыночной симуляции и генеративную большую рыночную foundation-модель, собранную из нескольких меньших авторегрессионных трансформеров: один кодирует обзор поведения пакетов истории, другой генерирует детализированные отдельные заявки, обеспечивая сочетание глобальной когерентности и высокой точности. К сожалению, код недоступен и авторы не тестировали модели на бенчмарках, поэтому напрямую сравниться с MARS мы не смогли. TRADES — трансформерный диффузионный движок для симуляций стакана — сочетает трансформеры с авторегрессионной диффузией временных рядов.
3.2. Глубокое обучение для прогноза с помощью изображений
Чтобы явно представить пространственно-временну́ю структуру стакана, входные данные можно представлять изображениями, как в DeepLOB и его расширениях. Авторы преобразуют вход в матрицу $(100, 40)$, где строки — время (100 последних обновлений книги), а столбцы — цена и объём на каждом уровне:
$$X = [x_1, x_2, \ldots, x_t, \ldots, x_{100}]^{\mathsf{T}} \in \mathbb{R}^{100 \times 40}$$
$$\text{где}\quad x_t = \left[p_a^{(i)}(t),\ v_a^{(i)}(t),\ p_b^{(i)}(t),\ v_b^{(i)}(t)\right]_{i=1}^{n=10}$$
Используются 10 верхних уровней книги: утверждается, что 80% информации содержится в первом уровне и 90% заявок никогда не исполняются, так что более десяти уровней добавляют лишь ненужный шум. Из-за перемешивания сторон, цен и объёмов такая компоновка требует специально сконструированных свёрточных фильтров. Мы предлагаем улучшения компоновки далее.
Другая работа предлагает альтернативный формат изображения для многоактивной постановки, но ради снижения размерности игнорирует полную книгу, используя лишь доходности средней цены. Ещё одна работа кодирует пакеты заявок как изображения особым образом, давая сводку числа заявок на покупку, продажу и снятий на каждом уровне цены и объёма; однако этот метод сжимает приблизительную долгосрочную информацию в компактное изображение, которое затем кодируется в единственный токен, и потому для генерации стакана высокой точности непригоден.
4. Методология
4.1. Теоретическое обоснование и мотивация
Высокочастотные финансовые данные крайне зашумлены из-за большого числа участников, высокой доли снятий, асинхронного потока заявок и микроструктурных эффектов. Это затрудняет извлечение сигнала из сырых данных, особенно без сжатой структуры или индуктивных смещений.
Мы утверждаем, что подход на основе изображений со свёрточной моделью обладает сильными теоретическими преимуществами:
- Инвариантность к сдвигу — свёртки естественно инвариантны к сдвигу. Стакан постоянно сдвигается вдоль временно́й оси по мере движения времени, и мы хотим, чтобы модель была к этим сдвигам инвариантна. Аналогично часты сдвиги ценовых уровней из-за снятия или исполнения целых уровней.
- Локальное извлечение признаков — свёрточная модель приспособлена обнаруживать и сжимать локальные паттерны по цене и времени.
- Разделение весов — свёрточная модель использует общие веса по ценовым уровням и по времени. Это делает её экономнее по параметрам и менее склонной к переобучению, что особенно уместно при высоком уровне шума.
- Индуктивное смещение к стационарности — локальные структуры и поведения, вероятно, повторяются по цене и времени.
- Иерархическое извлечение признаков — многие признаки составлены из простых локальных событий, а свёрточные сети отлично агрегируют их в более сложные через слои фильтров.
- Интерпретируемость — карты признаков в CNN интерпретируемее и позволяют относить итоговые выходы к конкретным ценово-временны́м областям через карты значимости. Это особенно уместно в финансовой области, где необходимо взаимодействие человека и машины.
Мы также утверждаем, что диффузионная модель с дорисовкой даёт существенные преимущества перед авторегрессионным подходом:
- Свёрточный костяк — многие диффузионные методы используют свёрточную основу, что полезно по всем перечисленным причинам.
- Передовой уровень в зрении — если подход на основе изображений обоснован, то диффузия есть естественный выбор.
- Структурированный шум — шум присущ финансовым рынкам, а диффузионные модели естественно работают с непрерывными данными и малыми возмущениями устойчиво, без переобучения.
- Параллельная генерация будущих шагов — диффузионные модели предсказывают весь выход одновременно. Это, возможно, ведёт к более быстрому выводу для длинных последовательностей, хотя и уравновешивается большим числом шагов итеративного шумоподавления.
- Разнообразие выходов — диффузионные модели особенно сильны в порождении разнообразных выходов, что особенно уместно при тяжёлых хвостах распределений финансовых данных.
- Параллельная генерация возможных исходов — варьируя зерно шума по батчу, можно параллельно получить диапазон возможных исходов.
- Смягчение накопленной ошибки — авторегрессионные модели предсказывают следующий токен последовательно, и ошибка на каждом шаге накапливается и распространяется. Диффузионные же порождают всю последовательность разом, без пошаговых зависимостей, так что ошибки генерации токенов независимы друг от друга.
4.2. Данные стакана как изображения
Мы используем представление стакана в виде изображения, улучшая компоновку ради более осмысленной временно́й и пространственной раскладки. Из длинного потока состояний стакана берётся окно фиксированной длины $T$ и верхние $n$ уровней книги.
Строится двухканальное изображение $X \in \mathbb{R}^{2n \times T \times 2}$:
- каждый столбец представляет состояние книги; движение по ширине от столбца 1 к $T$ есть движение вперёд во времени;
- каждая строка представляет ценовой уровень; движение по высоте от 1 к $2n$ повышает цену: начиная с самой низкой, наименее конкурентной цены покупки, мы движемся к самой высокой, наиболее конкурентной цене покупки; самая низкая, наиболее конкурентная цена продажи расположена непосредственно над лучшей ценой покупки, а самая высокая, наименее конкурентная цена продажи — вверху изображения;
- первый канал содержит цены, второй — объёмы.
Для нормировки на начальном шаге $t_0$ каждого окна вычисляется средняя цена $\text{mid}(t_0) = \left(p_a^{(1)}(t_0) + p_b^{(1)}(t_0)\right)/2$. Все последующие цены в окне центрируются вычитанием $\text{mid}(t_0)$. Объёмы на стороне продажи умножаются на $-1$, после чего объёмы считаются центрированными. Нормировка завершается делением на скользящее стандартное отклонение цен и объёмов. Данные обрезаются по 95-му процентилю во избежание экстремальных аномалий.
Учитывая избыток обучающих данных, каждый обучающий пример сдвигается вперёд на полную длину истории, так что каждый пример содержит целиком свежие данные.
Рисунок 1 — смотреть в оригинале (PDF)
Для подачи данных в модель мы следуем стандартной процедуре дорисовки и передаём три сложенных изображения: первое — исходное изображение целиком с добавленным шумом и в истории, и в будущем (каналы цены и объёма); второе — незашумлённая история с полностью замаскированным будущим (нули), также с двумя каналами; третье — маска дорисовки, с нулями в первых 64 шагах и единицами во вторых 64. В итоге получается вход формы (размер батча, $T$, $n$, 5).
4.3. Модель
Мы используем существующую реализацию безусловной модели UNet из библиотеки Hugging Face — хорошо документированный стандартный каркас, широко применяемый в современных диффузионных исследованиях. UNet использует свёрточный костяк, задающий сильные индуктивные смещения. В отличие от многих современных реализаций, наша модель работает непосредственно в пространстве изображения, а не в латентном, чтобы обеспечить простое выравнивание исторической маски.
Стандартные архитектуры UNet требуют квадратных входных и выходных изображений. Поэтому мы дополняем размерность уровней повторением каждого уровня, так что модель принимает вход формы $(T, T, 5)$ и выдаёт выход формы $(T, T, 2)$, что после предсказания обращается.
Архитектура использует 6 слоёв понижающей и 6 слоёв повышающей дискретизации с ростом числа фильтров по глубине в последовательности (128, 128, 256, 256, 512, 512). Каждый понижающий блок состоит из двух свёрточных слоёв с последующей нормализацией, активацией ReLU и пулингом. Пятый блок вводит самовнимание для улавливания дальних зависимостей ценой большего числа параметров. Повышающие блоки зеркальны и включают внимание во втором слое.
Рисунок 2 — смотреть в оригинале (PDF)
5. Эксперименты
5.1. Данные и постановка эксперимента
Мы берём те же примеры акции с малым тиком (Alphabet, GOOG) и с крупным тиком (Intel, INTC), что используются в LOB-Bench, на датасете LOBSTER. Малотиковые акции имеют более разреженные книги и более волатильные спреды, чем крупнотиковые. Данные ограничены основной торговой сессией; используется 102 дня обучающих данных (1 июля — 11 ноября 2022), 12 дней валидации (28 ноября — 13 декабря 2022) и 12 дней тестовых данных (14 — 30 декабря 2022). В отличие от LOBS5, наша модель не может использовать данные уровня 3 и рассматривает только уровень 2. Это означает, что нам доступно строго меньше данных и информации. Согласно принятой в бенчмарке практике используются классическая базовая модель Конта и соавторов, а также генеративные модели Coletta, RWKV-6 и LOBS5.
5.2. Обучение модели и качественные примеры
Для обучения используется один графический ускоритель Nvidia A40; отдельные модели обучаются на данных INTC и GOOG. Обучение идёт за один проход по данным без повторений, поскольку свежих качественных данных стакана в избытке. Обучение занимает 18 часов для INTC и 34 часа для GOOG; разница объясняется более высокой частотой обновлений книги у GOOG, что даёт больший обучающий набор в том же временно́м окне.
Время обучения растёт квадратично с высотой изображения. Поэтому мы ограничиваемся историей в 156 шагов и длиной предсказания в 100 шагов. Это соответствует исходному LOBS5 с окном предсказания 100 при сохранении степени двойки для разрешения ради вычислительной эффективности.
Рисунок 3 — смотреть в оригинале (PDF)
Модель работает значительно лучше на GOOG, чем на INTC, — и по воспринимаемому визуальному качеству, и в сравнении с другими моделями. Мы полагаем, что причина в крупном тике INTC, который не поощряет частое пересечение спреда и снижает высокочастотную волатильность. В результате изменения цены редки, сигнал в данных разрежен, что уменьшает объём полезной информации в коротких историях книги и ограничивает предсказательную силу модели.
На данных INTC модель испытывает существенные трудности (рисунок 4). Наблюдается коллапс мод по ценам: после шага 156 выход приблизительно схлопывается к модальному значению, и видна резкая граница. Эти ограничения потенциально преодолимы лучшим форматированием и сжатием данных или более крупными моделями, но это оставлено будущей работе. Поэтому в качестве флагманской для оценки мы берём модель GOOG.
Рисунок 4 — смотреть в оригинале (PDF)
Следуя предшествующим работам, мы сравнили общие распределения реальных и сгенерированных данных для модели GOOG. Модель способна уловить широкое целевое распределение по ключевым мерам — спреду, дисбалансу книги и объёмам. Заметна недооценка крупнообъёмных заявок; это может частично объясняться обрезанием крупнообъёмных событий в обучающих данных либо просто чрезмерным сглаживанием предсказаний объёма. В целом результаты показывают, что обе модели улавливают высокоуровневые статистические свойства стакана. Модель GOOG даёт содержательные и визуально правдоподобные выходы, тогда как модель INTC демонстрирует коллапс мод, что говорит о неспособности извлечь ценные сведения из истории — вероятно, из-за разреженного сигнала в данных.
5.3. Сравнение с генеративными методами на сообщениях
Мы сравниваем нашу модель с существующими методами из LOB-Bench на тех же обучающей и тестовой выборках. Несмотря на то что наша модель имеет доступ только к данным уровня 2 против более богатых данных уровня 3 у RWKV и LOBS5, она сопоставима по большинству метрик на GOOG.
Рисунок 5 — смотреть в оригинале (PDF)
Модель показывает сильные результаты на GOOG, превосходя LOBS5 по спреду при потере $L_1$ и достигая наилучших результатов по ряду метрик при потере Вассерштейна. В целом наша диффузионная модель обходит все модели, кроме LOBS5, при оценке по $L_1$, и достигает наилучшего результата по Вассерштейну в целом.
Это можно понять, если учесть, что потеря $L_1$ отражает средние абсолютные ошибки и чувствительна к локальным отклонениям, тогда как потеря Вассерштейна измеряет расстояние между целыми распределениями и чувствительна к глобальной форме и структуре. Это согласуется с наблюдаемыми стилизованными фактами для нашей модели на GOOG, где сгенерированные данные выглядят как сглаженная версия реальных, и с примерами изображений, где объёмы выглядят сглаженными. Кроме того, общепринятое мнение гласит, что диффузионные модели особенно хороши в моделировании глобального распределения, но могут сглаживать мелкие детали и давать размытые выходы.
Напротив, результативность на INTC значительно хуже эталонных моделей. Это согласуется с коллапсом мод и отказом модели, наблюдаемыми в качественных примерах, и отражает трудность обучения на разреженных данных уровня 2.
Рисунок 6 — смотреть в оригинале (PDF)
Рисунок 7 — смотреть в оригинале (PDF)
В целом результаты показывают, что наш метод способен достичь наилучшей результативности на GOOG, несмотря на обучение и тестирование на менее информативных данных. Тем самым метод даёт сильную альтернативу LOBS5, особенно когда данные уровня 3 недоступны.
5.4. Абляция по времени сэмплирования
Быстрый вывод существен для практических применений. Это верно и для прогноза и торговли в реальном времени, где выходы полезны, только если предсказаны до того, как события развернутся, — а это могут быть миллисекунды; и для офлайновых применений (тестирование на истории, симуляция контрфактов, обучение RL-агентов), где нужно обрабатывать большие объёмы данных и скорость вывода может стать узким местом.
Диффузионные модели естественно располагают к быстрой параллельной генерации, поскольку предсказывают всё изображение сразу. Однако стандартный вывод при нашем режиме обучения требует 1000 шагов на генерацию полного изображения, каждый — с прямым проходом через модель. В поисках более быстрого вывода при сохранении параллельности мы исследуем эффект сокращения числа шагов сэмплирования на этапе тестирования при фиксированных настройках и обучении. С теми же предобученными весами (обучение на 1000 шагах) мы тестируем 10, 50, 100 и 200 шагов вывода на INTC и GOOG.
Рисунок 8 — смотреть в оригинале (PDF)
Увеличение числа шагов вывода в целом ведёт к лучшим результатам по всем направлениям, но разница мала, особенно между 100 и 200 шагами, что иллюстрирует убывающую отдачу. По многим метрикам оценки лежат внутри доверительных интервалов. Для некоторых метрик, таких как дисбаланс потока заявок (OFI), увеличение шагов яснее ведёт к улучшению. Схожие закономерности наблюдаются и для GOOG, и для INTC.
Различия больше по $L_1$, чем по Вассерштейну, по той же причине, что и раньше: малое число шагов сэмплирования всё ещё позволяет уловить грубое общее распределение, но не даёт точности, которой требует $L_1$. В зависимости от приложения, жертва точностью ради быстрого вывода может быть оправдана — с учётом того, что увеличение числа шагов линейно по времени, так что 10 шагов в 100 раз быстрее 1000. Эти результаты подчёркивают ключевую сильную сторону подхода: диффузионные модели способны порождать целые последовательности стакана параллельно, возможно даже с очень малым числом шагов, что даёт высокую пропускную способность на длинных горизонтах прогноза.
5.5. Абляция по обобщаемости и устойчивости
Для практических применений было бы полезно, чтобы модель хорошо обобщалась и была устойчива к смене режима — то есть к переходу в период с распределенческим сдвигом, например с возросшей волатильностью. Полезно было бы также применять одну модель ко всем акциям либо обобщать её на новые, невиданные бумаги.
Для проверки мы тестируем модели, обученные исключительно на GOOG или INTC, на других данных. Ожидаемо модель INTC, слабая даже на своих тестовых данных, значительно уступает модели GOOG во всех областях. Интереснее другое: на тестовых данных INTC модель INTC, даже демонстрируя коллапс мод, всё же превосходит модель GOOG во всех областях по потере $L_1$ (которая благоволит локальной точности и должна сильнее штрафовать коллапс мод). Результаты схожи и для потери Вассерштейна, хотя модель GOOG превосходит по метрикам OFI. Это указывает на плохую обобщаемость GOOG.
Рисунок 9 — смотреть в оригинале (PDF)
В целом результаты экспериментов показывают, что диффузионный метод способен моделировать сложную динамику стакана и конкурировать с текущим передовым уровнем в постановке GOOG. Результативность на INTC изначально слабее, хотя модель всё же воспроизводит глобальные распределенческие свойства и обеспечивает быстрый параллельный вывод. Абляции показывают, что скорость сэмплирования можно повысить с минимальной деградацией качества, однако модель испытывает трудности с устойчивостью и обобщаемостью между разными акциями и доменами.
6. Заключение
6.1. Вклады
Мы вносим публичный вклад в LOB-Bench, позволяющий напрямую сравнивать генеративные модели стакана на данных уровня 2 и уровня 3. Мы предлагаем улучшенное представление стакана в виде изображения и диффузионный каркас для генеративного моделирования, использующий пространственно-временну́ю структуру данных. Это новый подход к задаче, обоснованный теоретическими соображениями и эмпирической результативностью. Несмотря на использование только данных уровня 2, наша модель сопоставима с передовыми моделями уровня 3, и мы исследуем её эффективность по сэмплированию и устойчивость строгими абляциями. Работа показывает, что диффузионные модели на изображениях — конкурентоспособный подход к генеративному моделированию стакана, особенно когда данные уровня 3 недоступны или когда приоритетом является распределенческое сходство, а не локальная точность.
6.2. Будущая работа
Будущая работа могла бы выполнять диффузию в латентном пространстве, как это принято в других реализациях, что позволило бы сжимать вход ради большего контекстного окна и снижать избыточность информации для разреженных тикеров. Это помогло бы прежде всего модели INTC. Более простой альтернативой могло бы стать ручное сжатие — например, брать обновления книги лишь каждые несколько шагов. Метод можно также протестировать в условной, а не дорисовочной постановке: мы потеряем часть интерпретируемости, индуктивного смещения и непрерывности, но выиграем в эффективности, поскольку история становится условным компонентом и явное шумоподавление нужно запускать только на окне предсказания (сейчас оно выполняется и на истории, и на предсказании, после чего историческая часть отбрасывается). Возможны и другие небольшие улучшения диффузионного метода — DDIM, прогрессивная дистилляция или тщательный перебор гиперпараметров.
6.3. Итоговые соображения
Наш метод достигает передовой результативности на отраслевом бенчмарке LOB-Bench. Хотя сейчас он сталкивается с трудностями на крупнотиковых акциях и с обобщаемостью, он вводит перспективную новую парадигму генеративного финансового моделирования. При большем объёме данных и дальнейших доработках диффузионные модели могут сыграть ключевую роль в будущем симуляции и прогноза лимитного стакана.
Литература
- L. Berti, B. Prenkaj, P. Velardi, TRADES: Generating realistic market simulations with diffusion models, arXiv:2502.07071 (2025).
- C. Cao, O. Hansch, X. Wang, The information content of an open limit-order book, Journal of Futures Markets 29(1) (2008) 16–41.
- A. Coletta и соавторы, Conditional generators for limit order book environments, ACM ICAIF (2023) 27–35.
- A. Coletta и соавторы, Towards realistic market simulations: a generative adversarial networks approach, ACM ICAIF (2021) 1–9.
- R. Cont, S. Stoikov, R. Talreja, A stochastic model for order book dynamics, Operations Research 58(3) (2010) 549–563.
- Z. Eisler, J.-P. Bouchaud, J. Kockelkoren, The price impact of order book events, Quantitative Finance 12(9) (2012) 1395–1419.
- M. D. Gould и соавторы, Limit order books, Quantitative Finance 13(11) (2013) 1709–1742.
- J. Ho, A. Jain, P. Abbeel, Denoising diffusion probabilistic models, NeurIPS 33 (2020) 6840–6851.
- R. Huang, T. Polak, LOBSTER: Limit Order Book Reconstruction System, SSRN (2011).
- D. Kisiel, D. Gorse, Axial-LOB: high-frequency trading with axial attention, IEEE SSCI (2022) 1327–1333.
- J. Li и соавторы, MarS: a financial market simulation engine powered by generative foundation model, ICLR (2025).
- T. Liu, S. Roberts, S. Zohren, Deep inception networks, arXiv:2307.05522 (2023).
- A. Lugmayr и соавторы, RePaint: inpainting using denoising diffusion probabilistic models, CVPR (2022) 11461–11471.
- C. Meng и соавторы, SDEdit: guided image synthesis and editing with stochastic differential equations, arXiv:2108.01073 (2021).
- P. Nagy и соавторы, Generative AI for end-to-end limit order book modelling, ACM ICAIF (2023) 91–99.
- P. Nagy и соавторы, LOB-Bench: benchmarking generative AI for finance, ICML (2025).
- B. Peng и соавторы, RWKV: reinventing RNNs for the transformer era, arXiv:2305.13048 (2023).
- R. Rombach и соавторы, High-resolution image synthesis with latent diffusion models, CVPR (2022) 10684–10695.
- Y. Zhang, M. Cucuringu, A. Y. Shestopaloff, S. Zohren, ClusterLOB, arXiv:2504.20349 (2025).
- Z. Zhang, S. Zohren, S. Roberts, DeepLOB: deep convolutional neural networks for limit order books, IEEE Transactions on Signal Processing 67 (2019) 3001–3012.