FlowOE: имитационное обучение с flow matching для оптимального исполнения при стохастической волатильности Хестона и вогнутом market impact

6.5/10

Yang Li (corresponding author), Zhi Chen · Department of Financial Engineering, Stevens Institute of Technology, Hoboken, NJ, USA

Оригинал: Li, Y. and Chen, Z. «FlowOE: Imitation Learning with Flow Matching for Optimal Execution under Heston Volatility and Concave Market Impacts», v1, 6 июня 2025 — arxiv.org/abs/2506.05755 (PDF).

Рисунки воспроизведены из оригинальной публикации.

Ключевые слова: Optimal Execution; Stochastic Volatility Control; Almgren–Chriss Model; Flow Matching; Imitation Learning.

Аннотация

Оптимальное исполнение (optimal execution, OE) на финансовых рынках — стратегическое проведение крупного объёма сделок за период времени с балансом между издержками market impact и риском тайминга или волатильности. Статические стратегии вроде модели Almgren–Chriss часто оказываются субоптимальными в динамичных рынках. В работе предложен FlowOE — новый каркас имитационного обучения на базе flow matching: он учится на разнообразном наборе экспертных традиционных стратегий и адаптивно выбирает наиболее подходящее экспертное поведение под текущие рыночные условия. По утверждению авторов, это первое применение flow matching к стохастической задаче оптимального исполнения. Эмпирические оценки в разных рыночных режимах показывают, что FlowOE существенно превосходит как специально откалиброванные экспертные модели, так и традиционные бенчмарки — выше прибыль при меньшем риске. Результаты подчёркивают практическую применимость FlowOE для адаптивного оптимального исполнения.

1. Введение

Оптимальное исполнение (OE) — стратегия проведения крупных объёмов активов за период для достижения наилучшего результата. Одновременно OE минимизирует риск исполнения, в частности неблагоприятные движения цены — market impact [23, 9, 1]. OE нужно для реализации инвестиционных стратегий, ребалансировки портфелей, реакции на новую информацию, управления клиентскими потоками и мандатами или просто из-за масштаба активов. OE важно и для инвесторов (лучшая доходность при меньших издержках), и для рынка (ликвидность, price discovery, стабильность).

Традиционные подходы вроде Almgren–Chriss [1] формулируют OE как задачу стохастического управления с аналитическим решением, но опираются на упрощающие допущения [11]. Например, волатильность считается константой на горизонте исполнения, тогда как в реальности она динамична и непредсказуема. Также часто предполагают линейную зависимость market impact от размера или скорости сделок; на практике связь нелинейна [20, 2]. По мере исполнения крупной заявки и накопительного потребления ликвидности маргинальный impact последующих сделок может расти нелинейно. Цель работы — каркас OE в более реалистичных динамических условиях и адаптивные стратегии исполнения на сложных рынках.

Традиционные модели с предварительной калибровкой параметров часто субоптимальны в динамике: они не подстраиваются под изменения ликвидности и волатильности в реальном времени. Для преодоления жёсткости и построения адаптивных стратегий исследователи всё чаще используют reinforcement learning (RL) [21]: агенты учат политики торговли через взаимодействие со средой и могут навигировать сложную, меняющуюся ликвидность. Ряд работ показывает, что RL может превосходить традиционные модели, адаптируя исполнение к текущим условиям [19]. Однако при развёртывании в новых или live-условиях возникает критическая проблема: стохастичность и шум рынков означают, что политики, выученные на симуляторе или историческом датасете, могут плохо обобщаться. RL-агенты часто хрупки: производительность резко падает при смене режима или out-of-distribution событиях, не встречавшихся при обучении.

Flow matching — недавний прогресс в генеративном моделировании [17, 27, 18] — хорошо учит сложные распределения и преобразования; в робототехнике это используется для imitation learning от демонстраций экспертов. Аналогичный перенос естественен для финансов: «эксперты» — не люди, а устоявшиеся модели (Almgren–Chriss, RL-агенты) или стратегии, оптимизированные под конкретные рыночные условия. Flow matching учится отображать рыночные состояния в распределения оптимальных действий, наблюдая разнообразных финансовых экспертов. Генеративная природа flow matching особенно подходит для мультимодальных распределений оптимальных действий в стохастических финансовых постановках. Li et al. [16] первыми исследовали imitation learning для высокочастотной торговли и показали, что модели на flow matching эффективно обучаются в стохастических финансовых средах.

Мотивированные этими вызовами и prior work, мы предлагаем FlowOE — каркас imitation learning на flow matching. Он учится на наборе экспертных традиционных стратегий — например, Almgren–Chriss, откалиброванных под разные рыночные сценарии. Идея: единая модель FlowOE распознаёт текущие условия и адаптивно выбирает или эмулирует наиболее подходящую экспертную стратегию. Далее — fine-tuning, ищущий корректирующее действие, добавляемое к выходу предобученной imitation-модели. Аддитивная схема использует экспертную стратегию как сильный baseline и итеративно улучшает результат относительно целей задачи.

Для оценки практической применимости FlowOE проведены эмпирические анализы в разных рыночных условиях. Сравнение с экспертными традиционными моделями (Almgren–Chriss и др.), откалиброванными под каждую среду, и со стандартными бенчмарками. FlowOE стабильно и существенно превосходит экспертов, даже специально настроенных под условия; фреймворк не только учится у экспертов, но и эффективно уточняет их действия. Во всех сценариях FlowOE обходит каждый бенчмарк — выше прибыль при меньшем риске. По утверждению авторов, это первое применение flow matching к стохастической финансовой среде в задаче OE.

2. Обзор литературы

Оптимальное исполнение — следствие рыночных frictions. В идеализированном полностью ликвидном рынке без издержек любой ордер любого размера исполнялся бы мгновенно по текущей цене [9]. Реальные рынки характеризуются «рационированием ликвидности»: ликвидность конечна, крупные заявки сталкиваются с ограничениями. Трейдеры несут прямые издержки (комиссии) и косвенные — bid-ask спред и price impact собственных сделок [25]. Классический каркас Almgren–Chriss декомпозирует market impact на два компонента. Временный (temporary) impact — немедленная ценовая уступка для исполнения; отражает стоимость потребления ликвидности из стакана и считается кратковременным: цена возвращается после снятия торгового давления. Постоянный (permanent) impact — устойчивый сдвиг равновесной цены, вызванный информационным содержанием сделки или изменением баланса спроса и предложения [7].

Разделение temporary/permanent в модели AC полезно концептуально, но упрощает реальность. Эмпирическая картина impact бросает вызов линейному допущению базовой модели Almgren–Chriss. Критическое теоретическое ограничение: при нелинейном permanent impact в стандартных arbitrage-free рамках permanent impact должен быть линейной функцией мгновенной скорости торговли, иначе возможен dynamic arbitrage — последовательность сделок (round trip), возвращающая к исходной позиции с положительной ожидаемой прибылью за счёт механизма impact. Если permanent impact был бы, например, вогнутой функцией только скорости, теоретически можно было бы построить «money machine». Линейность permanent impact создаёт дилемму: эмпирический суммарный impact часто вогнут. Наблюдаемая вогнутость требует моделей исполнения с нелинейными эффектами [14]. Для согласования с no-arbitrage рассматривают: (1) нелинейность в основном во временных/транзиентных компонентах при линейном permanent [4]; (2) более сложные модели, где permanent impact зависит от накопленного объёма и path-dependent признаков стратегии [2, 8].

Динамизм рынков — нелинейный impact, стохастическая ликвидность, меняющаяся волатильность, стратегическое поведение участников — делает статические расписания исполнения субоптимальными. Нелинейный impact означает, что стоимость торговли сложно зависит от скорости и размера. Стохастическая ликвидность — непредсказуемая способность рынка поглощать заявки. Торговая активность создаёт реактивную среду. Стратегии, адаптирующиеся к изменениям в реальном времени, потенциально дают существенный выигрыш.

Machine learning и RL в OE: агенты учат политики через взаимодействие со средой (live-рынок, исторический replay или симулятор) и feedback в виде наград/штрафов за качество исполнения (например, минимизация implementation shortfall) [3, 13, 21]. Q-learning, DQN и DDQN подходят для сложных пространств состояний и плохо моделируемой динамики; они могут неявно учитывать time-varying ликвидность и нелинейный impact, если среда обучения это отражает. Эмпирические работы часто сравнивают RL с TWAP, VWAP или статическим A-C; например, [15] использовал Q-learning для динамической коррекции траектории A-C по спреду и объёму в реальном времени и улучшил implementation shortfall до 10,3%. DDQN показывал сильные результаты при time-varying ликвидности. Эволюция от статических моделей к адаптивным стратегиям — trade-off между явностью модели и способностью к обучению. RL часто впечатляет в конкретной среде обучения, но при live-развёртывании политики, оптимизированные под прошлые состояния, могут быстро стать субоптимальными.

Для OE imitation learning (IL) может выучить эффективные стратегии из демонстраций экспертов или аналитических решателей. IL полезен, когда явное задание полной reward-функции для RL сложно: действия эксперта неявно кодируют нюансы целей и риска.

3. Задача оптимального исполнения

Оптимальное исполнение — задача финансовых институтов: реализовать решение купить или продать значительное количество $Q$ актива за период. Центральный вопрос — как провести сделку по наилучшей цене с учётом издержек, рисков и рыночных условий. Проблема остра для крупных заявок (metaorders), которые нельзя исполнить мгновенно без существенного adverse price movement. Крупный объём требует исполнения на расширенном горизонте $T$, иногда довольно длинном.

Задача: ликвидировать $X$ акций за конечный горизонт $T$, разбив $[0,T]$ на $N$ дискретных шагов. Пусть $t_k = k\tau$, $k=0,1,\ldots,N$, где $\tau = T/N$. Обозначим $n_k$ — число проданных акций на $(t_{k-1}, t_k]$, $k=1,\ldots,N$. Остаток инвентаря: $x_k = X - \sum_{i=1}^k n_i$, $x_0 = X$, $x_N = 0$. Цена сделки на шаге $k$ — $p_k$ за $n_k$ акций. Цель — найти оптимальную стратегию $\{n_1,\ldots,n_N\}$, минимизирующую ожидаемые издержки исполнения при контроле риска неопределённости цены при условии полной ликвидации к $T$.

Ключевая сложность — фундаментальные trade-off'ы: оптимизация одного аспекта качества исполнения влияет на другие. Есть напряжение между скоростью исполнения и market impact. Быстрое исполнение (высокая participation rate) агрессивно потребляет ликвидность, двигает цену сильнее и ухудшает среднюю цену исполнения. Медленное исполнение снижает impact, но повышает timing risk — риск adverse движений цены за длительный период; выгода от низкого impact может быть перекрыта неблагоприятным дрейфом. Слишком медленное исполнение ведёт к opportunity cost, если мотивация сделки ослабевает или горизонт исполнения превышает prediction horizon стратегии. Продвинутые методологии OE стремятся быть адаптивными и непрерывно пересматривать баланс в ответ на меняющиеся факторы.

Этот trade-off аналогичен efficient frontier в портфельной теории: при заданном уровне риска исполнения (например, дисперсии издержек) оптимальная стратегия минимизирует ожидаемую стоимость исполнения.

Трейдер ликвидирует $X_0$ акций на $[0,T]$. Пусть $X_t$ — остаток инвентаря в момент $t$. Динамика инвентаря:

\[ dX_t = -\nu_t\,dt, \qquad X_0 = \text{начальный инвентарь}. \tag{1} \]

Цель — минимизировать ожидаемую стоимость исполнения плюс штраф за риск:

\[ \min_{\{\nu_t\}} \mathbb{E}\left[\int_0^T \nu_t \tilde{S}_t\,dt + \lambda\,\mathrm{Var}\left(\int_0^T \nu_t \tilde{S}_t\,dt\right)\right] \tag{2} \]

при ограничении $X_T = 0$ (полная ликвидация). Здесь $\tilde{S}_t$ — цена исполнения, $\lambda$ — параметр неприятия риска.

4. Имитационное обучение

Flow matching обычно используется в imitation learning. Однако политика flow matching может точно моделировать условное распределение $p(A_{t+1}\mid O_t)$, но итеративное решение ODE с большим числом шагов $N$ может быть слишком медленным для жёстких требований низкой латентности OE. Поэтому выбрана Shortcut policy — ядро FlowOE [10], обозначаемая $s_\phi(a,t,\Delta t\mid O_t)$, специально обученная генерировать качественные последовательности действий за существенно меньшее число дискретизационных шагов. Политика conditioned на состояние $a$, время $t$, наблюдение $O_t$ и размер шага интегрирования $\Delta t$.

Обучение Shortcut policy $s_\phi$ (алгоритм 1, где $s_\theta$ в псевдокоде — $s_\phi$ с параметрами $\phi$) позволяет делать более крупные информированные дискретные шаги. Процедура сочетает две стратегии из rectified flow и consistency models [26].

Во-первых, для части обучающих данных (алгоритм 1, строки 4–7) политика направляется прямым целевым вектором $x_1 - x_0$ (аналог $a_E - a_0$ в пространстве действий). Здесь $x_0 \sim \mathcal{N}(0,I)$ — шум, $x_1 \sim \mathcal{D}$ — экспертная выборка, $x_t$ — интерполяция. При $d=0$ (строка 7) модель $s_\phi(x_t,t,0\mid O_t)$ неявно обучается выравниваться с прямой скоростью пути, поощряя более прямые траектории генерации.

Во-вторых, для остальных элементов батча (строки 9–15) политика обучается self-consistency objective в духе progressive distillation. Модель $s_\phi(x_t,t,2\Delta t_{\mathrm{small}}\mid O_t)$ предсказывает скорость, чьё применение за шаг $2\Delta t_{\mathrm{small}}$ совпадает с результатом двух последовательных малых шагов по $\Delta t_{\mathrm{small}}$. Цель для большого шага строится из stop-gradient предсказаний для малых шагов: $s_{\mathrm{target}} \leftarrow \mathrm{stopgrad}((s_t + s_{t+d})/2)$. Этот bootstrapping учит делать крупные, но точные дискретные скачки. Параметр $(d,t)$ на строке 3 позволяет сэмплировать разные малые $d$ и времена интерполяции $t$.

Алгоритм 1. Обучение Shortcut policy для OE
Вход: экспертный датасет E, модель s_θ, размер батча B, параметр p, датасет наблюдений O
повторять
  Сэмплировать батч {x^i_1}, {x^i_0} ~ N(0,I), {(d^i,t^i)}, {O^i_t}
  для i = 1 … ⌊p·B⌋:
    x^i_t ← (1 − t^i)·x^i_0 + t^i·x^i_1
    s^i_target ← (x^i_1 − x^i_0);  d^i ← 0
  для i = ⌊p·B⌋+1 … B:
    x^i_t ← (1 − t^i)·x^i_0 + t^i·x^i_1
    s^i_t ← s_θ(x^i_t, t^i, d^i | O^i_t)
    x^i_{t+d} ← x^i_t + d^i·s^i_t
    s^i_{t+d} ← s_θ(x^i_{t+d}, t^i + d^i, d^i | O^i_t)
    s^i_target ← stopgrad((s^i_t + s^i_{t+d})/2)
  Обновить θ, минимизируя (1/B) Σ ||s_θ(x^i_t, t^i, 2d^i | O^i_t) − s^i_target||²
до сходимости

После обучения Shortcut policy $s_\phi$ генерирует последовательности действий с существенно меньшими вычислительными затратами по алгоритму 2 ($s_\theta$ — обученная $s_\phi$). Число шагов $M$ можно задать малым (1–5), резко снижая латентность inference при сохранении качества благодаря специализированному обучению $s_\phi$.

Алгоритм 2. Inference Shortcut policy для OE
Вход: наблюдение O_t, обученная модель s_θ, число шагов M
Выход: торговая последовательность действий a_M
Сэмплировать a_0 ~ N(0,I);  d ← 1/M
для k = 0 … M−1:
  t_k ← k·d
  a_{k+1} ← a_k + d·s_θ(a_k, t_k, d | O_t)
вернуть a_M

5. Данные для имитационного обучения

Раздел описывает процедуру генерации данных для imitation learning. Сначала симулируются движения цены акции — динамическая, но контролируемая рыночная среда. Затем используются различные экспертные модели, каждая исполняет оптимальную торговую стратегию на симулированной динамике. По мере принятия решений экспертами систематически собираются последовательности рыночных состояний и соответствующих действий — датасет пар состояние–действие для обучения IL-агента.

5.1. Моделирование рынка

Обычно движение цены описывают геометрическим броуновским движением (GBM) с дрейфом и случайной компонентой. Критическое упрощение — постоянная волатильность. Реальная волатильность динамична; в работе используется модель Heston [22] для более реалистичного анализа, когда динамика волатильности — ключевой фактор.

5.1.1. Волатильность Хестона

Стохастическая волатильность означает, что волатильность актива — не фиксированный параметр, а случайная величина, эволюционирующая по собственному стохастическому процессу. На рынках волатильность меняется во времени, часто непредсказуемо; ликвидность тоже смещается. Эмпирически волатильность кластеризуется и mean-reverting. Волатильность — ключевой вход risk-averse OE как драйвер «timing risk» [6].

Модель Heston: мгновенная дисперсия цены следует mean-reverting square-root процессу Cox–Ingersoll–Ross (CIR). Волатильность случайно флуктуирует, но притягивается к долгосрочному среднему. Формально — пара коррелированных SDE: для цены $S_t$ и дисперсии $\nu_t$.

\[ dS_t = \mu S_t\,dt + \sqrt{\nu_t}\,S_t\,dW_t^S \tag{3} \]

Изменение $dS_t$ за $dt$ состоит из детерминированного дрейфа $\mu S_t\,dt$ ($\mu$ — ожидаемая доходность; под risk-neutral мерой $\mu$ заменяют на безрисковую ставку $r$ или $r-q$ при дивидендной доходности $q$) и стохастической диффузии $\sqrt{\nu_t}\,S_t\,dW_t^S$, где амплитуда шума пропорциональна цене и корню дисперсии; $dW_t^S$ — приращение винеровского процесса.

\[ d\nu_t = \kappa(\theta - \nu_t)\,dt + \xi\sqrt{\nu_t}\,dW_t^\nu \tag{4} \]

Дисперсия $\nu_t = \sigma_t^2$ эволюционирует по CIR/Feller square-root процессу. Член $\kappa(\theta-\nu_t)\,dt$ mean-reverting притягивает $\nu_t$ к долгосрочному уровню $\theta$ со скоростью $\kappa$. Член $\xi\sqrt{\nu_t}\,dW_t^\nu$ вносит стохастические флуктуации; $\xi$ — «volatility of volatility». Корень $\sqrt{\nu_t}$ помогает сохранять неотрицательность дисперсии.

\[ \mathrm{Corr}(dW_t^S, dW_t^\nu) = \rho\,dt \tag{5} \]

$\rho$ — мгновенная корреляция шоков цены и дисперсии; позволяет моделировать leverage effect (цена и волатильность часто движутся в противоположных направлениях).

5.1.2. Нелинейный market impact

Линейный market impact удобен для моделирования, но не отражает сложности реальных рынков. Эмпирика показывает, что мгновенный impact часто сильно вогнут по объёму торгов: при росте размера сделки дополнительный impact на маржинальную акцию убывает — в отличие от линейного допущения. Более тонкая перспектива — transient market impact [12, 9, 8]: impact постепенно затухает по мере восстановления ликвидности в стакане, моделируя resilience книги заявок.

При торговле со скоростью $\nu_t$ трейдер сталкивается с temporary и permanent impact. Цена исполнения $\tilde{S}_t$ отличается от mid-price из-за temporary impact:

\[ \tilde{S}_t = S_t - f(\nu_t) \tag{6} \]

где $f(\cdot)$ — функция temporary impact. Используется степенная спецификация:

\[ f(\nu) = \epsilon\,|\nu|^\beta \tag{7} \]

$\epsilon > 0$ — коэффициент temporary impact; $\beta \in (0,1]$ — параметр нелинейности. $\beta = 1$ — линейный impact (классический Almgren–Chriss); $\beta = 0{,}5$ — square-root impact (часто наблюдаемый); $\beta < 1$ — вогнутая функция (economies of scale в исполнении).

5.2. Сбор данных

Для экспертных бенчмарков подготовлен набор подходов: традиционные analytically tractable модели OE и reinforcement learning методы, адаптирующиеся к динамике рынка. Они служат «экспертами» в каркасе; детальное описание каждой модели — в приложении B оригинала.

Собираются траектории: векторы состояния $(t, X_t, S_t, V_t)$; действия $\nu_t$; рыночные параметры $(\mu, \kappa, \theta, \xi, \rho, \eta, \epsilon, \beta)$.

Среда симуляции. Ликвидация $X_0 = 10\,000$ акций за $T = 1{,}0$ (нормированный торговый день), $N = 100$ шагов (~4 минуты при 6,5-часовом дне). Начальная цена $S_0 = 100$. Динамика цены и дисперсии — дискретизированная модель Heston; цена исполнения:

\[ \tilde{S}_k = S(t_k) - \epsilon\,\nu_k^\beta, \tag{8} \]

где $\nu_k = x_k/\Delta t$ — скорость торговли, $x_k$ — объём на шаге $k$.

Параметрическое пространство. Исследуется широкое пространство параметров для оценки робастности стратегий. Таблица 1 суммирует значения, выбранные по эмпирике equity-рынков.

Таблица 1. Параметры симуляции.
ПараметрСимволЗначения
Динамика рынка
Дрейф$\mu${0.0, 0.02}
Начальная волатильность$\sqrt{V_0}${0.2, 0.3, 0.4}
Скорость mean reversion$\kappa$2.0
Долгосрочная волатильность$\sqrt{\theta}$0.3
Vol of vol$\xi${0.2, 0.3}
Корреляция$\rho$−0.7
Market impact
Permanent impact$\eta$$2{,}5 \times 10^{-5}$
Temporary impact$\epsilon$$5{,}0 \times 10^{-5}$
Нелинейность$\beta${0.2, 0.6, 0.9}
Риск
Неприятие риска$\lambda$$10^{-5}$

Обоснование: $\sqrt{V_0} \in \{0{,}2, 0{,}3, 0{,}4\}$ покрывает нормальные и stressed условия (годовая vol 20–40%). $\kappa = 2{,}0$ даёт half-life vol shock $\ln(2)/\kappa \approx 0{,}347$ года (~4,16 месяца). $\rho = -0{,}7$ — leverage effect. $\beta \in \{0{,}5, 1{,}0, 1{,}5\}$ в экспериментах (square-root, linear, super-linear). Коэффициенты $\eta$, $\epsilon$ откалиброваны под типичные equity-рынки.

Для каждой комбинации $(\mu, \sqrt{V_0}, \xi, \beta)$ симулируется $n = 100$ независимых эпизодов (seed 42). Общее число эпизодов:

\[ |\mu| \times |\sqrt{V_0}| \times |\xi| \times |\beta| \times |\text{Strategies}| \times n = 2 \times 3 \times 2 \times 3 \times 4 \times 100 = 14\,400. \tag{9} \]

Каждый эпизод — 100 шагов, ~1,44 млн точек состояние–действие. На шаге $k$ собираются: остаток времени $\tau_k = T - t_k$, инвентарь $q_k$, mid-price $S_k$, дисперсия $V_k$; действие $x_k$; исходы — цена исполнения $\tilde{S}_k$, cash $C_k$, implementation shortfall IS в конце эпизода.

6. Эксперименты и анализ результатов

Раздел описывает дизайн экспериментов и метрики сравнения подходов.

6.1. Бенчмарки

TWAP — равномерная ликвидация инвентаря во времени:

\[ \nu_k = \frac{X_0}{T}, \qquad x_k = \frac{X_0}{N}, \quad k = 0,1,\ldots,N-1. \tag{10} \]

Простая стратегия, игнорирующая рыночные условия; baseline.

VWAP — исполнение пропорционально предполагаемому объёмному профилю рынка. Доля объёма на шаге $k$ моделируется квадратичной функцией; нормированные веса $\omega_k$ задают распределение сделок:

\[ \omega_k = \frac{\left(2{,}5\frac{k}{N} - 0{,}5 + 0{,}5\right)^2}{\sum_{j=0}^{N-1}\left(2{,}5\frac{j}{N} - 0{,}5 + 0{,}5\right)^2}, \qquad x_k = X_0\,\omega_k, \quad \nu_k = \frac{x_k}{\Delta t}. \tag{11–12} \]

AC-Approx — адаптация Almgren–Chriss к нелинейному impact через эффективный линейный коэффициент:

\[ \epsilon_{\mathrm{eff}} = \epsilon\left(\frac{X_0}{T}\right)^{\beta-1}. \tag{13} \]

Скорость торговли из оптимальной траектории инвентаря:

\[ q(t) = X_0\,\frac{\sinh(\kappa(T-t))}{\sinh(\kappa T)}, \qquad \kappa = \sqrt{\frac{\lambda\theta}{\epsilon_{\mathrm{eff}}}}, \tag{14} \]

$x_k = q(t_k) - q(t_{k+1})$, $\nu_k = x_k/\Delta t$. При малом $\kappa T$ стратегия близка к TWAP: $x_k \approx X_0/N$.

Heston-Optimal — учитывает стохастическую волатильность и нелинейный impact; аналитическая скорость торговли:

\[ \nu^*(t) = (1+\beta)\left[\frac{q(t)}{T-t} + \frac{\theta + (V(t)-\theta)e^{-\kappa(T-t)}}{V(t)}\right]^{1/2}, \tag{17} \]

где $q(t)$ — текущий инвентарь, $V(t)$ — текущая дисперсия. Близко к $T$ применяется сглаженный переход к равномерной ликвидации (формула 18). На последнем шаге ликвидируется весь остаток.

Экспертные RL-стратегии (PPO) и Shortcut models, обученные на демонстрациях Heston-Optimal и PPO, описаны в приложении B оригинала.

6.2. Метрики оценки

Implementation shortfall — разница между идеальной стоимостью исполнения и фактическими поступлениями:

\[ \mathrm{IS} = X_0 S_0 - \int_0^T \nu_t \tilde{S}_t\,dt. \tag{20} \]

Оценка стратегий — Monte Carlo:

  1. Генерация $N$ траекторий $(S_t, V_t)$ схемой Milstein.
  2. Для каждой траектории и стратегии — торговая траектория $\{\nu_t\}$.
  3. Расчёт IS на симуляцию.
  4. Метрики: средний IS, STD, AC objective.

Дискретизированная динамика для численной реализации:

\[ \log S_{t+\Delta t} = \log S_t + \left(\mu - \frac{V_t}{2} - \eta\nu_t\right)\Delta t + \sqrt{V_t\,\Delta t}\,Z_1, \tag{21} \] \[ V_{t+\Delta t} = V_t + \kappa(\theta - V_t)\Delta t + \xi\sqrt{V_t\,\Delta t}\,(\rho Z_1 + \sqrt{1-\rho^2}\,Z_2) + \frac{\xi^2\Delta t}{4}\left((\rho Z_1 + \sqrt{1-\rho^2}\,Z_2)^2 - 1\right), \tag{22} \]

$Z_1, Z_2 \sim \mathcal{N}(0,1)$ — независимые стандартные нормальные.

6.3. Анализ результатов

Для валидации FlowOE проведены эксперименты в нескольких рыночных режимах с разной волатильностью и impact. Традиционные работы часто используют параметры concavity impact в диапазоне 0,4–0,7; здесь покрыты соответствующие случаи.

Эмпирика демонстрирует превосходство Shortcut Model по всем режимам и метрикам. Shortcut Model HO — Shortcut policy, обученная на демонстрациях Heston-Optimal. Shortcut Model PPO — на демонстрациях PPO. Shortcut стабильно даёт существенно меньший IS, ниже риск (STD) и лучше AC objective относительно AC-Approx, показывая, что модель не только учится у эксперта, но и улучшает стратегии. Shortcut также превосходит TWAP, VWAP, Heston-Optimal и предшественника — демонстрируя практическую полезность и робастность при разной vol и impact.

Сценарии (таблица 5, $\beta = 0{,}5$):

Таблица 2. Метрики при $\beta = 0{,}5$ (square-root, вогнутый рынок). OOS, 10 000 прогонов.
СтратегияHH: IS ↓HH: AC ↓HL: IS ↓HL: AC ↓LH: IS ↓LH: AC ↓LL: IS ↓LL: AC ↓
TWAP211 139476 59247 918211 143206 860475 82682 956279 960
VWAP210 908455 61147 777210 954200 471449 66279 660274 411
AC-Approx210 880427 38447 251211 105148 180266 82480 642276 136
Heston-Optimal210 592406 60749 261210 712178 424366 02471 359261 633
Shortcut HO210 994412 93543 336185 448179 652372 00982 750253 924
Shortcut PPO189 332269 14747 768105 978105 978155 65094 217130 392
Таблица 3. Метрики при $\beta = 0{,}8$ (менее вогнутый рынок).
СтратегияHH: AC ↓HL: AC ↓LH: AC ↓LL: AC ↓
TWAP478 077206 860281 445105 391
AC-Approx474 248200 230281 190104 502
Heston-Optimal382 047179 647256 22784 808
Shortcut PPO177 22928 701236 31438 667
Таблица 4. Метрики при $\beta = 0{,}3$ (сильно вогнутый рынок).
СтратегияHH: AC ↓HL: AC ↓LH: AC ↓LL: AC ↓
AC-Approx328 31994 434261 45467 760
Heston-Optimal428 870187 963267 59195 966
Shortcut PPO200 72728 433244 96538 476
Таблица 5. Параметры рыночных сценариев ($\beta = 0{,}5$).
ПараметрHHHLLHLL
Горизонт $T$1.01.01.01.0
Начальный объём $X_0$10 00010 00010 00010 000
Начальная цена $S_0$100100100100
Начальная дисперсия $V_0$0.16 (40% vol)0.160.04 (20% vol)0.04
Permanent impact $\eta$$5\times10^{-5}$$1\times10^{-5}$$5\times10^{-5}$$1\times10^{-5}$
Temporary impact $\epsilon$$1\times10^{-4}$$2\times10^{-5}$$1\times10^{-4}$$2\times10^{-5}$
Vol of vol $\xi$0.50.50.20.2

На рисунках 1–3 иллюстрируется систематическая ликвидация крупного инвентаря за 100 шагов с плавным снижением почти до нуля. Средняя кривая — mean, синяя область — standard error. Продажи оказывают давление на цену (market impact): цена падает примерно с 102 ниже 80. Cash накапливается, но темп замедляется по мере падения цены и сокращения инвентаря. Средняя волатильность стабильна около 0,30. Снижение инвентаря высоко согласовано; пути цены и итоговый cash показывают растущую неопределённость (SE) со временем. Средняя скорость торговли динамична — высокая в начале, ниже в середине, частичное восстановление к концу — с существенной вариабельностью между сценариями, что указывает на адаптивную или агрегированную стратегию.

Рисунок 1
Рисунок 1. Одна траектория: инвентарь, цена, cash, волатильность и скорость торговли за 100 шагов ликвидации.
Рисунок 2
Рисунок 2. Shortcut policy, обученная на экспертах Heston-Optimal: сравнение распределений действий и качества имитации.
Рисунок 3
Рисунок 3. Shortcut policy, обученная на экспертах PPO: сравнение распределений действий и качества имитации.

7. Заключение

Работа представила FlowOE — каркас imitation learning на flow matching для оптимального исполнения на стохастических финансовых рынках. Подход Shortcut policy снял ограничения вычислительной латентности при сохранении мощного distributional modeling. Эмпирическая оценка в разных рыночных условиях показала, что FlowOE стабильно превосходит традиционные бенчмарки. В сильно вогнутых рынках ($\beta = 0{,}3$) фреймворк снижает implementation shortfall до 10,9% относительно аппроксимаций Almgren–Chriss при сокращении риска на 68%. Способность Shortcut policy сократить inference с сотен шагов ODE до 1–5 делает real-time развёртывание реалистичным.

Успех опирается на три вклада: (1) эффективное обучение от разнообразных экспертных стратегий с адаптивным выбором поведения; (2) существенное снижение латентности через специализированные процедуры обучения; (3) возможность находить улучшения сверх экспертной производительности через fine-tuning. Результаты имеют практические последствия для институциональной торговли — путь к более адаптивным и cost-effective стратегиям исполнения. Направления будущей работы: multi-asset постановки, дополнительные microstructure-признаки, интеграция с RL. По утверждению авторов, это первое успешное применение flow matching к стохастическому оптимальному исполнению с теоретическими и эмпирически подтверждёнными улучшениями.

Приложение A. Динамика рынка

Mid-price $S(t)$ и дисперсия $V(t)$ следуют модели Heston с permanent market impact:

\[ dS(t) = (\mu - \eta\nu(t))\,S(t)\,dt + \sqrt{V(t)}\,S(t)\,dW^S(t), \tag{A.1} \] \[ dV(t) = \kappa(\theta - V(t))\,dt + \xi\sqrt{V(t)}\,dW^\nu(t), \tag{A.2} \]

Цена исполнения включает нелинейный temporary impact:

\[ \tilde{S}(t) = S(t) - \epsilon\,\nu(t)^\beta, \qquad \epsilon > 0,\; \beta \in (0,1]. \tag{A.3} \]

Динамика инвентаря и cash:

\[ dq(t) = -\nu(t)\,dt, \quad q(0) = X_0,\; q(T) \geq 0; \tag{A.4} \] \[ dC(t) = \nu(t)\left(S(t) - \epsilon\,\nu(t)^\beta\right)dt. \tag{A.5} \]

Параметры определены в таблице A.6 оригинала ($\mu$ — дрейф, $\eta$ — permanent impact, $\kappa$, $\theta$, $\xi$, $\rho$ — параметры Heston, $\epsilon$, $\beta$ — temporary impact, $\lambda$ — risk aversion).

Приложения B и C. Экспертные модели и MDP

Приложение B содержит детальное описание экспертных моделей оптимального исполнения: классическая постановка Almgren–Chriss с HJB-формулировкой (B.1–B.4), генерация экспертных траекторий через Proximal Policy Optimization (B.2), систематическая генерация траекторий (B.3), state-dependent trading strategy (B.4) и схемы дискретизации (B.5). Приложение C формулирует задачу как MDP и описывает реализацию Gymnasium-среды OptimalExecutionHestonEnv (C.7): нормализованное состояние, непрерывное действие, динамика Heston с CIR–Milstein, нелинейный temporary и линейный permanent impact, reward как минус издержки исполнения и штраф за inventory risk.

Полные технические выводы, доказательства и псевдокод RL-тренировки опущены в этом переводе. См. оригинал: arxiv.org/pdf/2506.05755 (36 стр.).

Литература

Оригинал статьи: Li and Chen, «FlowOE: Imitation Learning with Flow Matching for Optimal Execution under Heston Volatility and Concave Market Impacts», arXiv:2506.05755