FlowOE: имитационное обучение с flow matching для оптимального исполнения при стохастической волатильности Хестона и вогнутом market impact
Yang Li (corresponding author), Zhi Chen · Department of Financial Engineering, Stevens Institute of Technology, Hoboken, NJ, USA
Оригинал: Li, Y. and Chen, Z. «FlowOE: Imitation Learning with Flow Matching for Optimal Execution under Heston Volatility and Concave Market Impacts», v1, 6 июня 2025 — arxiv.org/abs/2506.05755 (PDF).
Рисунки воспроизведены из оригинальной публикации.
Ключевые слова: Optimal Execution; Stochastic Volatility Control; Almgren–Chriss Model; Flow Matching; Imitation Learning.
Аннотация
Оптимальное исполнение (optimal execution, OE) на финансовых рынках — стратегическое проведение крупного объёма сделок за период времени с балансом между издержками market impact и риском тайминга или волатильности. Статические стратегии вроде модели Almgren–Chriss часто оказываются субоптимальными в динамичных рынках. В работе предложен FlowOE — новый каркас имитационного обучения на базе flow matching: он учится на разнообразном наборе экспертных традиционных стратегий и адаптивно выбирает наиболее подходящее экспертное поведение под текущие рыночные условия. По утверждению авторов, это первое применение flow matching к стохастической задаче оптимального исполнения. Эмпирические оценки в разных рыночных режимах показывают, что FlowOE существенно превосходит как специально откалиброванные экспертные модели, так и традиционные бенчмарки — выше прибыль при меньшем риске. Результаты подчёркивают практическую применимость FlowOE для адаптивного оптимального исполнения.
1. Введение
Оптимальное исполнение (OE) — стратегия проведения крупных объёмов активов за период для достижения наилучшего результата. Одновременно OE минимизирует риск исполнения, в частности неблагоприятные движения цены — market impact [23, 9, 1]. OE нужно для реализации инвестиционных стратегий, ребалансировки портфелей, реакции на новую информацию, управления клиентскими потоками и мандатами или просто из-за масштаба активов. OE важно и для инвесторов (лучшая доходность при меньших издержках), и для рынка (ликвидность, price discovery, стабильность).
Традиционные подходы вроде Almgren–Chriss [1] формулируют OE как задачу стохастического управления с аналитическим решением, но опираются на упрощающие допущения [11]. Например, волатильность считается константой на горизонте исполнения, тогда как в реальности она динамична и непредсказуема. Также часто предполагают линейную зависимость market impact от размера или скорости сделок; на практике связь нелинейна [20, 2]. По мере исполнения крупной заявки и накопительного потребления ликвидности маргинальный impact последующих сделок может расти нелинейно. Цель работы — каркас OE в более реалистичных динамических условиях и адаптивные стратегии исполнения на сложных рынках.
Традиционные модели с предварительной калибровкой параметров часто субоптимальны в динамике: они не подстраиваются под изменения ликвидности и волатильности в реальном времени. Для преодоления жёсткости и построения адаптивных стратегий исследователи всё чаще используют reinforcement learning (RL) [21]: агенты учат политики торговли через взаимодействие со средой и могут навигировать сложную, меняющуюся ликвидность. Ряд работ показывает, что RL может превосходить традиционные модели, адаптируя исполнение к текущим условиям [19]. Однако при развёртывании в новых или live-условиях возникает критическая проблема: стохастичность и шум рынков означают, что политики, выученные на симуляторе или историческом датасете, могут плохо обобщаться. RL-агенты часто хрупки: производительность резко падает при смене режима или out-of-distribution событиях, не встречавшихся при обучении.
Flow matching — недавний прогресс в генеративном моделировании [17, 27, 18] — хорошо учит сложные распределения и преобразования; в робототехнике это используется для imitation learning от демонстраций экспертов. Аналогичный перенос естественен для финансов: «эксперты» — не люди, а устоявшиеся модели (Almgren–Chriss, RL-агенты) или стратегии, оптимизированные под конкретные рыночные условия. Flow matching учится отображать рыночные состояния в распределения оптимальных действий, наблюдая разнообразных финансовых экспертов. Генеративная природа flow matching особенно подходит для мультимодальных распределений оптимальных действий в стохастических финансовых постановках. Li et al. [16] первыми исследовали imitation learning для высокочастотной торговли и показали, что модели на flow matching эффективно обучаются в стохастических финансовых средах.
Мотивированные этими вызовами и prior work, мы предлагаем FlowOE — каркас imitation learning на flow matching. Он учится на наборе экспертных традиционных стратегий — например, Almgren–Chriss, откалиброванных под разные рыночные сценарии. Идея: единая модель FlowOE распознаёт текущие условия и адаптивно выбирает или эмулирует наиболее подходящую экспертную стратегию. Далее — fine-tuning, ищущий корректирующее действие, добавляемое к выходу предобученной imitation-модели. Аддитивная схема использует экспертную стратегию как сильный baseline и итеративно улучшает результат относительно целей задачи.
Для оценки практической применимости FlowOE проведены эмпирические анализы в разных рыночных условиях. Сравнение с экспертными традиционными моделями (Almgren–Chriss и др.), откалиброванными под каждую среду, и со стандартными бенчмарками. FlowOE стабильно и существенно превосходит экспертов, даже специально настроенных под условия; фреймворк не только учится у экспертов, но и эффективно уточняет их действия. Во всех сценариях FlowOE обходит каждый бенчмарк — выше прибыль при меньшем риске. По утверждению авторов, это первое применение flow matching к стохастической финансовой среде в задаче OE.
2. Обзор литературы
Оптимальное исполнение — следствие рыночных frictions. В идеализированном полностью ликвидном рынке без издержек любой ордер любого размера исполнялся бы мгновенно по текущей цене [9]. Реальные рынки характеризуются «рационированием ликвидности»: ликвидность конечна, крупные заявки сталкиваются с ограничениями. Трейдеры несут прямые издержки (комиссии) и косвенные — bid-ask спред и price impact собственных сделок [25]. Классический каркас Almgren–Chriss декомпозирует market impact на два компонента. Временный (temporary) impact — немедленная ценовая уступка для исполнения; отражает стоимость потребления ликвидности из стакана и считается кратковременным: цена возвращается после снятия торгового давления. Постоянный (permanent) impact — устойчивый сдвиг равновесной цены, вызванный информационным содержанием сделки или изменением баланса спроса и предложения [7].
Разделение temporary/permanent в модели AC полезно концептуально, но упрощает реальность. Эмпирическая картина impact бросает вызов линейному допущению базовой модели Almgren–Chriss. Критическое теоретическое ограничение: при нелинейном permanent impact в стандартных arbitrage-free рамках permanent impact должен быть линейной функцией мгновенной скорости торговли, иначе возможен dynamic arbitrage — последовательность сделок (round trip), возвращающая к исходной позиции с положительной ожидаемой прибылью за счёт механизма impact. Если permanent impact был бы, например, вогнутой функцией только скорости, теоретически можно было бы построить «money machine». Линейность permanent impact создаёт дилемму: эмпирический суммарный impact часто вогнут. Наблюдаемая вогнутость требует моделей исполнения с нелинейными эффектами [14]. Для согласования с no-arbitrage рассматривают: (1) нелинейность в основном во временных/транзиентных компонентах при линейном permanent [4]; (2) более сложные модели, где permanent impact зависит от накопленного объёма и path-dependent признаков стратегии [2, 8].
Динамизм рынков — нелинейный impact, стохастическая ликвидность, меняющаяся волатильность, стратегическое поведение участников — делает статические расписания исполнения субоптимальными. Нелинейный impact означает, что стоимость торговли сложно зависит от скорости и размера. Стохастическая ликвидность — непредсказуемая способность рынка поглощать заявки. Торговая активность создаёт реактивную среду. Стратегии, адаптирующиеся к изменениям в реальном времени, потенциально дают существенный выигрыш.
Machine learning и RL в OE: агенты учат политики через взаимодействие со средой (live-рынок, исторический replay или симулятор) и feedback в виде наград/штрафов за качество исполнения (например, минимизация implementation shortfall) [3, 13, 21]. Q-learning, DQN и DDQN подходят для сложных пространств состояний и плохо моделируемой динамики; они могут неявно учитывать time-varying ликвидность и нелинейный impact, если среда обучения это отражает. Эмпирические работы часто сравнивают RL с TWAP, VWAP или статическим A-C; например, [15] использовал Q-learning для динамической коррекции траектории A-C по спреду и объёму в реальном времени и улучшил implementation shortfall до 10,3%. DDQN показывал сильные результаты при time-varying ликвидности. Эволюция от статических моделей к адаптивным стратегиям — trade-off между явностью модели и способностью к обучению. RL часто впечатляет в конкретной среде обучения, но при live-развёртывании политики, оптимизированные под прошлые состояния, могут быстро стать субоптимальными.
Для OE imitation learning (IL) может выучить эффективные стратегии из демонстраций экспертов или аналитических решателей. IL полезен, когда явное задание полной reward-функции для RL сложно: действия эксперта неявно кодируют нюансы целей и риска.
3. Задача оптимального исполнения
Оптимальное исполнение — задача финансовых институтов: реализовать решение купить или продать значительное количество $Q$ актива за период. Центральный вопрос — как провести сделку по наилучшей цене с учётом издержек, рисков и рыночных условий. Проблема остра для крупных заявок (metaorders), которые нельзя исполнить мгновенно без существенного adverse price movement. Крупный объём требует исполнения на расширенном горизонте $T$, иногда довольно длинном.
Задача: ликвидировать $X$ акций за конечный горизонт $T$, разбив $[0,T]$ на $N$ дискретных шагов. Пусть $t_k = k\tau$, $k=0,1,\ldots,N$, где $\tau = T/N$. Обозначим $n_k$ — число проданных акций на $(t_{k-1}, t_k]$, $k=1,\ldots,N$. Остаток инвентаря: $x_k = X - \sum_{i=1}^k n_i$, $x_0 = X$, $x_N = 0$. Цена сделки на шаге $k$ — $p_k$ за $n_k$ акций. Цель — найти оптимальную стратегию $\{n_1,\ldots,n_N\}$, минимизирующую ожидаемые издержки исполнения при контроле риска неопределённости цены при условии полной ликвидации к $T$.
Ключевая сложность — фундаментальные trade-off'ы: оптимизация одного аспекта качества исполнения влияет на другие. Есть напряжение между скоростью исполнения и market impact. Быстрое исполнение (высокая participation rate) агрессивно потребляет ликвидность, двигает цену сильнее и ухудшает среднюю цену исполнения. Медленное исполнение снижает impact, но повышает timing risk — риск adverse движений цены за длительный период; выгода от низкого impact может быть перекрыта неблагоприятным дрейфом. Слишком медленное исполнение ведёт к opportunity cost, если мотивация сделки ослабевает или горизонт исполнения превышает prediction horizon стратегии. Продвинутые методологии OE стремятся быть адаптивными и непрерывно пересматривать баланс в ответ на меняющиеся факторы.
Этот trade-off аналогичен efficient frontier в портфельной теории: при заданном уровне риска исполнения (например, дисперсии издержек) оптимальная стратегия минимизирует ожидаемую стоимость исполнения.
Трейдер ликвидирует $X_0$ акций на $[0,T]$. Пусть $X_t$ — остаток инвентаря в момент $t$. Динамика инвентаря:
\[ dX_t = -\nu_t\,dt, \qquad X_0 = \text{начальный инвентарь}. \tag{1} \]Цель — минимизировать ожидаемую стоимость исполнения плюс штраф за риск:
\[ \min_{\{\nu_t\}} \mathbb{E}\left[\int_0^T \nu_t \tilde{S}_t\,dt + \lambda\,\mathrm{Var}\left(\int_0^T \nu_t \tilde{S}_t\,dt\right)\right] \tag{2} \]при ограничении $X_T = 0$ (полная ликвидация). Здесь $\tilde{S}_t$ — цена исполнения, $\lambda$ — параметр неприятия риска.
4. Имитационное обучение
Flow matching обычно используется в imitation learning. Однако политика flow matching может точно моделировать условное распределение $p(A_{t+1}\mid O_t)$, но итеративное решение ODE с большим числом шагов $N$ может быть слишком медленным для жёстких требований низкой латентности OE. Поэтому выбрана Shortcut policy — ядро FlowOE [10], обозначаемая $s_\phi(a,t,\Delta t\mid O_t)$, специально обученная генерировать качественные последовательности действий за существенно меньшее число дискретизационных шагов. Политика conditioned на состояние $a$, время $t$, наблюдение $O_t$ и размер шага интегрирования $\Delta t$.
Обучение Shortcut policy $s_\phi$ (алгоритм 1, где $s_\theta$ в псевдокоде — $s_\phi$ с параметрами $\phi$) позволяет делать более крупные информированные дискретные шаги. Процедура сочетает две стратегии из rectified flow и consistency models [26].
Во-первых, для части обучающих данных (алгоритм 1, строки 4–7) политика направляется прямым целевым вектором $x_1 - x_0$ (аналог $a_E - a_0$ в пространстве действий). Здесь $x_0 \sim \mathcal{N}(0,I)$ — шум, $x_1 \sim \mathcal{D}$ — экспертная выборка, $x_t$ — интерполяция. При $d=0$ (строка 7) модель $s_\phi(x_t,t,0\mid O_t)$ неявно обучается выравниваться с прямой скоростью пути, поощряя более прямые траектории генерации.
Во-вторых, для остальных элементов батча (строки 9–15) политика обучается self-consistency objective в духе progressive distillation. Модель $s_\phi(x_t,t,2\Delta t_{\mathrm{small}}\mid O_t)$ предсказывает скорость, чьё применение за шаг $2\Delta t_{\mathrm{small}}$ совпадает с результатом двух последовательных малых шагов по $\Delta t_{\mathrm{small}}$. Цель для большого шага строится из stop-gradient предсказаний для малых шагов: $s_{\mathrm{target}} \leftarrow \mathrm{stopgrad}((s_t + s_{t+d})/2)$. Этот bootstrapping учит делать крупные, но точные дискретные скачки. Параметр $(d,t)$ на строке 3 позволяет сэмплировать разные малые $d$ и времена интерполяции $t$.
Алгоритм 1. Обучение Shortcut policy для OE
Вход: экспертный датасет E, модель s_θ, размер батча B, параметр p, датасет наблюдений O
повторять
Сэмплировать батч {x^i_1}, {x^i_0} ~ N(0,I), {(d^i,t^i)}, {O^i_t}
для i = 1 … ⌊p·B⌋:
x^i_t ← (1 − t^i)·x^i_0 + t^i·x^i_1
s^i_target ← (x^i_1 − x^i_0); d^i ← 0
для i = ⌊p·B⌋+1 … B:
x^i_t ← (1 − t^i)·x^i_0 + t^i·x^i_1
s^i_t ← s_θ(x^i_t, t^i, d^i | O^i_t)
x^i_{t+d} ← x^i_t + d^i·s^i_t
s^i_{t+d} ← s_θ(x^i_{t+d}, t^i + d^i, d^i | O^i_t)
s^i_target ← stopgrad((s^i_t + s^i_{t+d})/2)
Обновить θ, минимизируя (1/B) Σ ||s_θ(x^i_t, t^i, 2d^i | O^i_t) − s^i_target||²
до сходимости
После обучения Shortcut policy $s_\phi$ генерирует последовательности действий с существенно меньшими вычислительными затратами по алгоритму 2 ($s_\theta$ — обученная $s_\phi$). Число шагов $M$ можно задать малым (1–5), резко снижая латентность inference при сохранении качества благодаря специализированному обучению $s_\phi$.
Алгоритм 2. Inference Shortcut policy для OE
Вход: наблюдение O_t, обученная модель s_θ, число шагов M
Выход: торговая последовательность действий a_M
Сэмплировать a_0 ~ N(0,I); d ← 1/M
для k = 0 … M−1:
t_k ← k·d
a_{k+1} ← a_k + d·s_θ(a_k, t_k, d | O_t)
вернуть a_M
5. Данные для имитационного обучения
Раздел описывает процедуру генерации данных для imitation learning. Сначала симулируются движения цены акции — динамическая, но контролируемая рыночная среда. Затем используются различные экспертные модели, каждая исполняет оптимальную торговую стратегию на симулированной динамике. По мере принятия решений экспертами систематически собираются последовательности рыночных состояний и соответствующих действий — датасет пар состояние–действие для обучения IL-агента.
5.1. Моделирование рынка
Обычно движение цены описывают геометрическим броуновским движением (GBM) с дрейфом и случайной компонентой. Критическое упрощение — постоянная волатильность. Реальная волатильность динамична; в работе используется модель Heston [22] для более реалистичного анализа, когда динамика волатильности — ключевой фактор.
5.1.1. Волатильность Хестона
Стохастическая волатильность означает, что волатильность актива — не фиксированный параметр, а случайная величина, эволюционирующая по собственному стохастическому процессу. На рынках волатильность меняется во времени, часто непредсказуемо; ликвидность тоже смещается. Эмпирически волатильность кластеризуется и mean-reverting. Волатильность — ключевой вход risk-averse OE как драйвер «timing risk» [6].
Модель Heston: мгновенная дисперсия цены следует mean-reverting square-root процессу Cox–Ingersoll–Ross (CIR). Волатильность случайно флуктуирует, но притягивается к долгосрочному среднему. Формально — пара коррелированных SDE: для цены $S_t$ и дисперсии $\nu_t$.
\[ dS_t = \mu S_t\,dt + \sqrt{\nu_t}\,S_t\,dW_t^S \tag{3} \]Изменение $dS_t$ за $dt$ состоит из детерминированного дрейфа $\mu S_t\,dt$ ($\mu$ — ожидаемая доходность; под risk-neutral мерой $\mu$ заменяют на безрисковую ставку $r$ или $r-q$ при дивидендной доходности $q$) и стохастической диффузии $\sqrt{\nu_t}\,S_t\,dW_t^S$, где амплитуда шума пропорциональна цене и корню дисперсии; $dW_t^S$ — приращение винеровского процесса.
\[ d\nu_t = \kappa(\theta - \nu_t)\,dt + \xi\sqrt{\nu_t}\,dW_t^\nu \tag{4} \]Дисперсия $\nu_t = \sigma_t^2$ эволюционирует по CIR/Feller square-root процессу. Член $\kappa(\theta-\nu_t)\,dt$ mean-reverting притягивает $\nu_t$ к долгосрочному уровню $\theta$ со скоростью $\kappa$. Член $\xi\sqrt{\nu_t}\,dW_t^\nu$ вносит стохастические флуктуации; $\xi$ — «volatility of volatility». Корень $\sqrt{\nu_t}$ помогает сохранять неотрицательность дисперсии.
\[ \mathrm{Corr}(dW_t^S, dW_t^\nu) = \rho\,dt \tag{5} \]$\rho$ — мгновенная корреляция шоков цены и дисперсии; позволяет моделировать leverage effect (цена и волатильность часто движутся в противоположных направлениях).
5.1.2. Нелинейный market impact
Линейный market impact удобен для моделирования, но не отражает сложности реальных рынков. Эмпирика показывает, что мгновенный impact часто сильно вогнут по объёму торгов: при росте размера сделки дополнительный impact на маржинальную акцию убывает — в отличие от линейного допущения. Более тонкая перспектива — transient market impact [12, 9, 8]: impact постепенно затухает по мере восстановления ликвидности в стакане, моделируя resilience книги заявок.
При торговле со скоростью $\nu_t$ трейдер сталкивается с temporary и permanent impact. Цена исполнения $\tilde{S}_t$ отличается от mid-price из-за temporary impact:
\[ \tilde{S}_t = S_t - f(\nu_t) \tag{6} \]где $f(\cdot)$ — функция temporary impact. Используется степенная спецификация:
\[ f(\nu) = \epsilon\,|\nu|^\beta \tag{7} \]$\epsilon > 0$ — коэффициент temporary impact; $\beta \in (0,1]$ — параметр нелинейности. $\beta = 1$ — линейный impact (классический Almgren–Chriss); $\beta = 0{,}5$ — square-root impact (часто наблюдаемый); $\beta < 1$ — вогнутая функция (economies of scale в исполнении).
5.2. Сбор данных
Для экспертных бенчмарков подготовлен набор подходов: традиционные analytically tractable модели OE и reinforcement learning методы, адаптирующиеся к динамике рынка. Они служат «экспертами» в каркасе; детальное описание каждой модели — в приложении B оригинала.
Собираются траектории: векторы состояния $(t, X_t, S_t, V_t)$; действия $\nu_t$; рыночные параметры $(\mu, \kappa, \theta, \xi, \rho, \eta, \epsilon, \beta)$.
Среда симуляции. Ликвидация $X_0 = 10\,000$ акций за $T = 1{,}0$ (нормированный торговый день), $N = 100$ шагов (~4 минуты при 6,5-часовом дне). Начальная цена $S_0 = 100$. Динамика цены и дисперсии — дискретизированная модель Heston; цена исполнения:
\[ \tilde{S}_k = S(t_k) - \epsilon\,\nu_k^\beta, \tag{8} \]где $\nu_k = x_k/\Delta t$ — скорость торговли, $x_k$ — объём на шаге $k$.
Параметрическое пространство. Исследуется широкое пространство параметров для оценки робастности стратегий. Таблица 1 суммирует значения, выбранные по эмпирике equity-рынков.
| Параметр | Символ | Значения |
|---|---|---|
| Динамика рынка | ||
| Дрейф | $\mu$ | {0.0, 0.02} |
| Начальная волатильность | $\sqrt{V_0}$ | {0.2, 0.3, 0.4} |
| Скорость mean reversion | $\kappa$ | 2.0 |
| Долгосрочная волатильность | $\sqrt{\theta}$ | 0.3 |
| Vol of vol | $\xi$ | {0.2, 0.3} |
| Корреляция | $\rho$ | −0.7 |
| Market impact | ||
| Permanent impact | $\eta$ | $2{,}5 \times 10^{-5}$ |
| Temporary impact | $\epsilon$ | $5{,}0 \times 10^{-5}$ |
| Нелинейность | $\beta$ | {0.2, 0.6, 0.9} |
| Риск | ||
| Неприятие риска | $\lambda$ | $10^{-5}$ |
Обоснование: $\sqrt{V_0} \in \{0{,}2, 0{,}3, 0{,}4\}$ покрывает нормальные и stressed условия (годовая vol 20–40%). $\kappa = 2{,}0$ даёт half-life vol shock $\ln(2)/\kappa \approx 0{,}347$ года (~4,16 месяца). $\rho = -0{,}7$ — leverage effect. $\beta \in \{0{,}5, 1{,}0, 1{,}5\}$ в экспериментах (square-root, linear, super-linear). Коэффициенты $\eta$, $\epsilon$ откалиброваны под типичные equity-рынки.
Для каждой комбинации $(\mu, \sqrt{V_0}, \xi, \beta)$ симулируется $n = 100$ независимых эпизодов (seed 42). Общее число эпизодов:
\[ |\mu| \times |\sqrt{V_0}| \times |\xi| \times |\beta| \times |\text{Strategies}| \times n = 2 \times 3 \times 2 \times 3 \times 4 \times 100 = 14\,400. \tag{9} \]Каждый эпизод — 100 шагов, ~1,44 млн точек состояние–действие. На шаге $k$ собираются: остаток времени $\tau_k = T - t_k$, инвентарь $q_k$, mid-price $S_k$, дисперсия $V_k$; действие $x_k$; исходы — цена исполнения $\tilde{S}_k$, cash $C_k$, implementation shortfall IS в конце эпизода.
6. Эксперименты и анализ результатов
Раздел описывает дизайн экспериментов и метрики сравнения подходов.
6.1. Бенчмарки
TWAP — равномерная ликвидация инвентаря во времени:
\[ \nu_k = \frac{X_0}{T}, \qquad x_k = \frac{X_0}{N}, \quad k = 0,1,\ldots,N-1. \tag{10} \]Простая стратегия, игнорирующая рыночные условия; baseline.
VWAP — исполнение пропорционально предполагаемому объёмному профилю рынка. Доля объёма на шаге $k$ моделируется квадратичной функцией; нормированные веса $\omega_k$ задают распределение сделок:
\[ \omega_k = \frac{\left(2{,}5\frac{k}{N} - 0{,}5 + 0{,}5\right)^2}{\sum_{j=0}^{N-1}\left(2{,}5\frac{j}{N} - 0{,}5 + 0{,}5\right)^2}, \qquad x_k = X_0\,\omega_k, \quad \nu_k = \frac{x_k}{\Delta t}. \tag{11–12} \]AC-Approx — адаптация Almgren–Chriss к нелинейному impact через эффективный линейный коэффициент:
\[ \epsilon_{\mathrm{eff}} = \epsilon\left(\frac{X_0}{T}\right)^{\beta-1}. \tag{13} \]Скорость торговли из оптимальной траектории инвентаря:
\[ q(t) = X_0\,\frac{\sinh(\kappa(T-t))}{\sinh(\kappa T)}, \qquad \kappa = \sqrt{\frac{\lambda\theta}{\epsilon_{\mathrm{eff}}}}, \tag{14} \]$x_k = q(t_k) - q(t_{k+1})$, $\nu_k = x_k/\Delta t$. При малом $\kappa T$ стратегия близка к TWAP: $x_k \approx X_0/N$.
Heston-Optimal — учитывает стохастическую волатильность и нелинейный impact; аналитическая скорость торговли:
\[ \nu^*(t) = (1+\beta)\left[\frac{q(t)}{T-t} + \frac{\theta + (V(t)-\theta)e^{-\kappa(T-t)}}{V(t)}\right]^{1/2}, \tag{17} \]где $q(t)$ — текущий инвентарь, $V(t)$ — текущая дисперсия. Близко к $T$ применяется сглаженный переход к равномерной ликвидации (формула 18). На последнем шаге ликвидируется весь остаток.
Экспертные RL-стратегии (PPO) и Shortcut models, обученные на демонстрациях Heston-Optimal и PPO, описаны в приложении B оригинала.
6.2. Метрики оценки
- AC (Almgren–Chriss objective): $\mathbb{E}[\mathrm{IS}] + \lambda\,\mathrm{Var}[\mathrm{IS}]$ — ожидаемый implementation shortfall плюс штраф за дисперсию (меньше — лучше).
- STD: стандартное отклонение implementation shortfall.
- Volatility of Execution Cost: STD издержек исполнения по симуляциям — риск стратегии.
- Implied Shortfall (IS): pre-trade оценка ожидаемых издержек крупного ордера.
Implementation shortfall — разница между идеальной стоимостью исполнения и фактическими поступлениями:
\[ \mathrm{IS} = X_0 S_0 - \int_0^T \nu_t \tilde{S}_t\,dt. \tag{20} \]Оценка стратегий — Monte Carlo:
- Генерация $N$ траекторий $(S_t, V_t)$ схемой Milstein.
- Для каждой траектории и стратегии — торговая траектория $\{\nu_t\}$.
- Расчёт IS на симуляцию.
- Метрики: средний IS, STD, AC objective.
Дискретизированная динамика для численной реализации:
\[ \log S_{t+\Delta t} = \log S_t + \left(\mu - \frac{V_t}{2} - \eta\nu_t\right)\Delta t + \sqrt{V_t\,\Delta t}\,Z_1, \tag{21} \] \[ V_{t+\Delta t} = V_t + \kappa(\theta - V_t)\Delta t + \xi\sqrt{V_t\,\Delta t}\,(\rho Z_1 + \sqrt{1-\rho^2}\,Z_2) + \frac{\xi^2\Delta t}{4}\left((\rho Z_1 + \sqrt{1-\rho^2}\,Z_2)^2 - 1\right), \tag{22} \]$Z_1, Z_2 \sim \mathcal{N}(0,1)$ — независимые стандартные нормальные.
6.3. Анализ результатов
Для валидации FlowOE проведены эксперименты в нескольких рыночных режимах с разной волатильностью и impact. Традиционные работы часто используют параметры concavity impact в диапазоне 0,4–0,7; здесь покрыты соответствующие случаи.
Эмпирика демонстрирует превосходство Shortcut Model по всем режимам и метрикам. Shortcut Model HO — Shortcut policy, обученная на демонстрациях Heston-Optimal. Shortcut Model PPO — на демонстрациях PPO. Shortcut стабильно даёт существенно меньший IS, ниже риск (STD) и лучше AC objective относительно AC-Approx, показывая, что модель не только учится у эксперта, но и улучшает стратегии. Shortcut также превосходит TWAP, VWAP, Heston-Optimal и предшественника — демонстрируя практическую полезность и робастность при разной vol и impact.
Сценарии (таблица 5, $\beta = 0{,}5$):
- HH (High Volatility & High Impact): vol 40%, высокие издержки impact.
- HL (High Volatility & Low Impact): vol 40%, низкий impact.
- LH (Low Volatility & High Impact): vol 20%, высокий impact.
- LL (Low Volatility & Low Impact): vol 20%, низкий impact.
| Стратегия | HH: IS ↓ | HH: AC ↓ | HL: IS ↓ | HL: AC ↓ | LH: IS ↓ | LH: AC ↓ | LL: IS ↓ | LL: AC ↓ |
|---|---|---|---|---|---|---|---|---|
| TWAP | 211 139 | 476 592 | 47 918 | 211 143 | 206 860 | 475 826 | 82 956 | 279 960 |
| VWAP | 210 908 | 455 611 | 47 777 | 210 954 | 200 471 | 449 662 | 79 660 | 274 411 |
| AC-Approx | 210 880 | 427 384 | 47 251 | 211 105 | 148 180 | 266 824 | 80 642 | 276 136 |
| Heston-Optimal | 210 592 | 406 607 | 49 261 | 210 712 | 178 424 | 366 024 | 71 359 | 261 633 |
| Shortcut HO | 210 994 | 412 935 | 43 336 | 185 448 | 179 652 | 372 009 | 82 750 | 253 924 |
| Shortcut PPO | 189 332 | 269 147 | 47 768 | 105 978 | 105 978 | 155 650 | 94 217 | 130 392 |
| Стратегия | HH: AC ↓ | HL: AC ↓ | LH: AC ↓ | LL: AC ↓ |
|---|---|---|---|---|
| TWAP | 478 077 | 206 860 | 281 445 | 105 391 |
| AC-Approx | 474 248 | 200 230 | 281 190 | 104 502 |
| Heston-Optimal | 382 047 | 179 647 | 256 227 | 84 808 |
| Shortcut PPO | 177 229 | 28 701 | 236 314 | 38 667 |
| Стратегия | HH: AC ↓ | HL: AC ↓ | LH: AC ↓ | LL: AC ↓ |
|---|---|---|---|---|
| AC-Approx | 328 319 | 94 434 | 261 454 | 67 760 |
| Heston-Optimal | 428 870 | 187 963 | 267 591 | 95 966 |
| Shortcut PPO | 200 727 | 28 433 | 244 965 | 38 476 |
| Параметр | HH | HL | LH | LL |
|---|---|---|---|---|
| Горизонт $T$ | 1.0 | 1.0 | 1.0 | 1.0 |
| Начальный объём $X_0$ | 10 000 | 10 000 | 10 000 | 10 000 |
| Начальная цена $S_0$ | 100 | 100 | 100 | 100 |
| Начальная дисперсия $V_0$ | 0.16 (40% vol) | 0.16 | 0.04 (20% vol) | 0.04 |
| Permanent impact $\eta$ | $5\times10^{-5}$ | $1\times10^{-5}$ | $5\times10^{-5}$ | $1\times10^{-5}$ |
| Temporary impact $\epsilon$ | $1\times10^{-4}$ | $2\times10^{-5}$ | $1\times10^{-4}$ | $2\times10^{-5}$ |
| Vol of vol $\xi$ | 0.5 | 0.5 | 0.2 | 0.2 |
На рисунках 1–3 иллюстрируется систематическая ликвидация крупного инвентаря за 100 шагов с плавным снижением почти до нуля. Средняя кривая — mean, синяя область — standard error. Продажи оказывают давление на цену (market impact): цена падает примерно с 102 ниже 80. Cash накапливается, но темп замедляется по мере падения цены и сокращения инвентаря. Средняя волатильность стабильна около 0,30. Снижение инвентаря высоко согласовано; пути цены и итоговый cash показывают растущую неопределённость (SE) со временем. Средняя скорость торговли динамична — высокая в начале, ниже в середине, частичное восстановление к концу — с существенной вариабельностью между сценариями, что указывает на адаптивную или агрегированную стратегию.
7. Заключение
Работа представила FlowOE — каркас imitation learning на flow matching для оптимального исполнения на стохастических финансовых рынках. Подход Shortcut policy снял ограничения вычислительной латентности при сохранении мощного distributional modeling. Эмпирическая оценка в разных рыночных условиях показала, что FlowOE стабильно превосходит традиционные бенчмарки. В сильно вогнутых рынках ($\beta = 0{,}3$) фреймворк снижает implementation shortfall до 10,9% относительно аппроксимаций Almgren–Chriss при сокращении риска на 68%. Способность Shortcut policy сократить inference с сотен шагов ODE до 1–5 делает real-time развёртывание реалистичным.
Успех опирается на три вклада: (1) эффективное обучение от разнообразных экспертных стратегий с адаптивным выбором поведения; (2) существенное снижение латентности через специализированные процедуры обучения; (3) возможность находить улучшения сверх экспертной производительности через fine-tuning. Результаты имеют практические последствия для институциональной торговли — путь к более адаптивным и cost-effective стратегиям исполнения. Направления будущей работы: multi-asset постановки, дополнительные microstructure-признаки, интеграция с RL. По утверждению авторов, это первое успешное применение flow matching к стохастическому оптимальному исполнению с теоретическими и эмпирически подтверждёнными улучшениями.
Приложение A. Динамика рынка
Mid-price $S(t)$ и дисперсия $V(t)$ следуют модели Heston с permanent market impact:
\[ dS(t) = (\mu - \eta\nu(t))\,S(t)\,dt + \sqrt{V(t)}\,S(t)\,dW^S(t), \tag{A.1} \] \[ dV(t) = \kappa(\theta - V(t))\,dt + \xi\sqrt{V(t)}\,dW^\nu(t), \tag{A.2} \]Цена исполнения включает нелинейный temporary impact:
\[ \tilde{S}(t) = S(t) - \epsilon\,\nu(t)^\beta, \qquad \epsilon > 0,\; \beta \in (0,1]. \tag{A.3} \]Динамика инвентаря и cash:
\[ dq(t) = -\nu(t)\,dt, \quad q(0) = X_0,\; q(T) \geq 0; \tag{A.4} \] \[ dC(t) = \nu(t)\left(S(t) - \epsilon\,\nu(t)^\beta\right)dt. \tag{A.5} \]Параметры определены в таблице A.6 оригинала ($\mu$ — дрейф, $\eta$ — permanent impact, $\kappa$, $\theta$, $\xi$, $\rho$ — параметры Heston, $\epsilon$, $\beta$ — temporary impact, $\lambda$ — risk aversion).
Приложения B и C. Экспертные модели и MDP
Приложение B содержит детальное описание экспертных моделей оптимального исполнения: классическая постановка Almgren–Chriss с HJB-формулировкой (B.1–B.4), генерация экспертных траекторий через Proximal Policy Optimization (B.2), систематическая генерация траекторий (B.3), state-dependent trading strategy (B.4) и схемы дискретизации (B.5). Приложение C формулирует задачу как MDP и описывает реализацию Gymnasium-среды OptimalExecutionHestonEnv (C.7): нормализованное состояние, непрерывное действие, динамика Heston с CIR–Milstein, нелинейный temporary и линейный permanent impact, reward как минус издержки исполнения и штраф за inventory risk.
Полные технические выводы, доказательства и псевдокод RL-тренировки опущены в этом переводе. См. оригинал: arxiv.org/pdf/2506.05755 (36 стр.).
Литература
- [1] Almgren, R., Chriss, N., 2001. Optimal execution of portfolio transactions. Journal of Risk 3, 5–39.
- [2] Almgren, R.F., 2003. Optimal execution with nonlinear impact functions and trading-enhanced risk. Applied mathematical finance 10, 1–18.
- [3] Bergault, P., Guéant, O., Bodor, H., 2025. To hedge or not to hedge: Optimal strategies for stochastic trade flow management. arXiv preprint arXiv:2503.02496.
- [4] Brigo, D., Piat, C., 2019. Static versus adapted optimal execution strategies in two benchmark trading models, in: Innovations in Insurance, Risk-and Asset Management. World Scientific, pp. 239–273.
- [5] Brockman, G., Cheung, V., Pettersson, L., Schneider, J., Schulman, J., Tang, J., Zaremba, W., 2016. Openai gym. arXiv:1606.01540.
- [6] Chan, P., Sircar, R., 2015. Optimal trading with predictable return and stochastic volatility. Available at SSRN 2623747.
- [7] Cheng, X., Di Giacinto, M., Wang, T.H., 2017. Optimal execution with uncertain order fills in almgren–chriss framework. Quantitative Finance 17, 55–69.
- [8] Curato, G., Gatheral, J., Lillo, F., 2017. Optimal execution with nonlinear transient market impact. Quantitative Finance 17, 41–54.
- [9] Donnelly, R., 2022. Optimal execution: A review. Applied Mathematical Finance 29, 181–212.
- [10] Frans, K., Hafner, D., Levine, S., Abbeel, P., 2024. One step diffusion via shortcut models. arXiv preprint arXiv:2410.12557.
- [11] Gatheral, J., Schied, A., 2011. Optimal trade execution under geometric brownian motion in the almgren and chriss framework. International Journal of Theoretical and Applied Finance 14, 353–368.
- [12] Guéant, O., 2013. Permanent market impact can be nonlinear. arXiv preprint arXiv:1305.0413.
- [13] Hafsi, Y., Vittori, E., 2024. Optimal execution with reinforcement learning. arXiv preprint arXiv:2411.06389.
- [14] Harford, J., Kaul, A., 2005. Correlated order flow: Pervasiveness, sources, and pricing effects. Journal of Financial and Quantitative Analysis 40, 29–55.
- [15] Hendricks, D., Wilcox, D., 2014. A reinforcement learning extension to the almgren-chriss framework for optimal trade execution, in: 2014 IEEE Conference on computational intelligence for financial engineering & economics (CIFEr), IEEE. pp. 457–464.
- [16] Li, Y., Chen, Z., Yang, S., 2025. Flowhft: Flow policy induced optimal high-frequency trading under diverse market conditions. arXiv preprint arXiv:2505.05784.
- [17] Lipman, Y., Hagaj, R., Cohen-Or, D., 2022. Flow matching for generative modeling. arXiv preprint arXiv:2210.02747.
- [18] Liu, Q., 2022. Rectified flow: A marginal preserving approach to optimal transport. arXiv preprint arXiv:2209.14577.
- [19] Lorenz, J., Almgren, R., 2011. Mean–variance optimal adaptive execution. Applied Mathematical Finance 18, 395–422.
- [20] Ma, J., Gao, D., 2020. A class of optimal liquidation problem with a nonlinear temporary market impact. Mathematical Problems in Engineering 2020, 6614177.
- [21] Macrì, A., Lillo, F., 2025. Reinforcement learning for optimal execution when liquidity is time-varying. Applied Mathematical Finance, 1–31.
- [22] Mikhailov, S., Nögel, U., 2004. Heston's stochastic volatility model: Implementation, calibration and some extensions. John Wiley and Sons.
- [23] Obizhaeva, A.A., Wang, J., 2013. Optimal trading strategy and supply/demand dynamics. Journal of Financial markets 16, 1–32.
- [24] Schulman, J., Wolski, F., Dhariwal, P., Radford, A., Klimov, O., 2017. Proximal policy optimization algorithms. arXiv preprint arXiv:1707.06347.
- [25] Skachkov, I., 2009. Optimal execution: Linear market impact with exponential decay. Available at SSRN 2283027.
- [26] Song, Y., Dhariwal, P., Chen, M., Sutskever, I., 2023. Consistency models.
- [27] Tong, A., Malkin, N., Huguet, G., Zhang, Y., Rector-Brooks, J., Fatras, K., Wolf, G., Bengio, Y., 2023. Conditional flow matching: Simulation-free dynamic optimal transport. arXiv preprint arXiv:2302.00482.
Оригинал статьи: Li and Chen, «FlowOE: Imitation Learning with Flow Matching for Optimal Execution under Heston Volatility and Concave Market Impacts», arXiv:2506.05755