Offline-подход к обучению моделей пропагатора

6.5/10

Eyal Neuman, Wolfgang Stockinger, Yufei Zhang · Department of Mathematics, Imperial College London · 7 сентября 2023

Оригинал: Neuman, E., Stockinger, W. and Zhang, Y. «An Offline Learning Approach to Propagator Models», v1 — arxiv.org/abs/2309.02994 (PDF, 43 стр.).

Рис. 1–4 воспроизведены из оригинальной публикации. Оригинал распространяется по лицензии CC BY 4.0; перевод выполнен на её условиях, изменение по отношению к оригиналу — перевод на русский язык.

MSC (2010): 62L05, 60H30, 91G80, 68Q32, 93C73, 93E35, 62G08 · JEL: C02, C61, G11

Ключевые слова: optimal portfolio liquidation, price impact, propagator models, predictive signals, Volterra stochastic control, offline reinforcement learning, nonparametric estimation, pessimistic principle, regret analysis.

Аннотация

Рассматривается offline-задача обучения: агент сначала оценивает неизвестное ядро ценового воздействия (price impact kernel) по статическому датасету, а затем проектирует стратегии ликвидации рискованного актива с транзиентным price impact. Предложен новый подход к непараметрической оценке пропагатора по данным, содержащим коррелированные ценовые траектории, торговые сигналы и метаордера. Точность оценённого пропагатора количественно характеризуется метрикой, явно зависящей от качества датасета.

Показано, что трейдер, минимизирующий издержки исполнения жадной стратегией, построенной только на оценённом пропагаторе, сталкивается с субоптимальностью из-за ложной корреляции (spurious correlation) между торговой стратегией и оценщиком, а также из-за внутренней неопределённости (intrinsic uncertainty), обусловленной смещённым функционалом издержек. В духе offline reinforcement learning вводится пессимистичный функционал потерь, учитывающий неопределённость оценки пропагатора, и оптимизатор, устраняющий ложную корреляцию; получена асимптотически оптимальная верхняя оценка издержек исполнения даже без точного знания истинного пропагатора. Численные эксперименты демонстрируют эффективность предложенного оценщика и пессимистичной торговой стратегии.

1. Введение

Price impact — эмпирический факт, что исполнение крупного ордера неблагоприятно и устойчиво сдвигает цену актива, ухудшая условия для трейдера. Точная оценка price impact транзакций критична для прибыльных стратегий. Модели пропагатора (propagator models) — центральный инструмент математического описания этих явлений (Bouchaud et al. [9], Gatheral [20]): ценовые движения выражаются через влияние прошлых сделок и дают надёжное reduced-form представление реакции limit order book на исполнение.

Агент, ликвидирующий крупный ордер, обычно дробит метаордер на дочерние ордера $\{u_{t_j}: 0=t_1<\ldots \[ S_{t_{i+1}} = S_{t_1} + \sum_{j=1}^{i} G_{i,j}\, u_{t_j} + A_{t_i} + \varepsilon_{t_i}, \qquad i=1,\ldots,M, \tag{1.1} \]

где $A+\varepsilon$ — фундаментальная (не затронутая сделками) цена; $A$ — торговый сигнал, $\varepsilon$ — шум с нулевым средним. Элементы $G_{i,j}$ обычно затухают при $j\gg i$ — сумма справа называется транзиентным price impact. Классический пример Almgren–Chriss: если все элементы $G$ схожи, сумма описывает постоянный impact; при $G=\lambda I$ — временный impact.

Трейдер наблюдает видимую цену $S$, собственные сделки $u$ и сигнал $A$. Для количественной оценки impact и проектирования стратегии нужна точная оценка $G$. Оценщики для свёрточного случая ($G_{i,j}=G_{i-j}$) предложены в [9, 18, 38, 40] и гл. 13.2 [10]; регрессионные методы распространены в индустрии, но игнорируют ill-posedness МНК, зависимости между траекториями и ложные корреляции между оценщиком и жадными стратегиями — сходимость и скорости остаются открытой проблемой.

В [34] предложен непараметрический подход для непрерывного аналога (1.1) с острыми границами скорости сходимости, зависящими от сингулярности пропагатора; оценка была рассчитана на online RL, где агент торгует в среде. Недостатки [34]: стратегия должна быть похожей и детерминированной во всех эпизодах; ценовые траекторы предполагались независимыми — неприменимо на переполненных рынках с общими сигналами [33]. Главное: online-обучение для ликвидации портфеля дорого — один sample path $(S,u,A)$ требует исполнения по субоптимальной стратегии. Большинство калибровок пропагатора делают offline; fine-tuning — online.

Цели работы:

Датасет $D$ из $N$ траекторий цен, сигналов и метаордеров:

\[ D = \bigl\{(S^{(n)}, u^{(n)}, A^{(n)}) \mid n=1,\ldots,N\bigr\}. \tag{1.2} \]

Вклад в оценку пропагатора (теоремы 2.10, 2.14): ослабление независимости траекторий (условная sub-Gaussianность шума, Assumption 2.8); допустимы любые price-adaptive стратегии $u^{(n)}$; оценка неконvolution пропагаторов; для convolution — существенно более быстрая сходимость (Remark 2.15); новая норма

\[ \|\hat G - G\|_{V_{N,\lambda}} := \|(\hat G - G) V_{N,\lambda}^{1/2}\|, \tag{1.3} \]

количественно связывающая ошибку оценки с качеством датасета и играющая ключевую роль в пессимистичном offline RL. $V_{N,\lambda}$ измеряет ковариацию $u^{(n)}$ в $D$ (см. (2.18)).

Функционал издержек исполнения объёма $x_0$ на $[0,T]$:

\[ J(u; G) = \mathbb{E}\left[\sum_{i=1}^{M}\sum_{j=1}^{i} G_{i,j}\, u_{t_j}\, u_{t_i} + \sum_{i=1}^{M} A_{t_i}\, u_{t_i}\right], \tag{1.4} \]

где $u=(u_{t_i})_{i=1}^M$ удовлетворяет fuel constraint $\sum_i u_{t_i}=x_0$. Двухшаговая процедура «оценка $G$ → жадная оптимизация $J(u;\hat G)$» попадает в рамки offline RL с патологическими эффектами:

Обозначения: $(G^\star, u^\star, J)$ — истинный пропагатор, оптимальная стратегия и функционал (1.4); $(\hat G, \hat u, \hat J)$ — оценка ядра, выпуклый функционал на $\hat G$ и жадная стратегия. Субоптимальность:

\[ \mathrm{SubOpt} = J(\hat u; G^\star) - J(u^\star; G^\star). \]

Декомпозиция (по аналогии с Lemma 3.1 [25]):

\[ \mathrm{SubOpt} = \underbrace{J(\hat u; G^\star) - \hat J(\hat u; \hat G)}_{\text{(i) Spurious Correlation}} + \underbrace{\hat J(u^\star; \hat G) - J(u^\star; G^\star)}_{\text{(ii) Intrinsic Uncertainty}} + \underbrace{\hat J(\hat u; \hat G) - \hat J(u^\star; \hat G)}_{\text{(iii) Optimization Error}}. \tag{1.5} \]

Член (i) наиболее труден: $\hat u$, $\hat G$ и $\hat J$ одновременно зависят от $D$. Example A.1 (Appendix A) показывает существенную субоптимальность жадной стратегии. Член (ii) проще — $u^\star$ не зависит от $D$. Член (iii) $\leq 0$ при жадности $\hat u$.

Для минимизации субоптимальности — пессимистичный offline RL framework. Ключевое понятие — $\delta$-uncertainty quantifier:

Определение 1.1 ($\delta$-uncertainty quantifier). $\Gamma: \mathcal{A}\to\mathbb{R}_+$ — $\delta$-uncertainty quantifier относительно $P'$ (мера, порождающая датасет), если событие

\[ A = \bigl\{|J(u;G^\star) - J(u;\hat G)| \leq \Gamma(u),\ \forall u\in\mathcal{A}\bigr\} \]

удовлетворяет $P'(A)\geq 1-\delta$ для $\delta\in(0,1)$.

Кандидат для $\hat J$, устраняющий ложную корреляцию:

\[ \hat J(u; \hat G) = J(u; \hat G) + \Gamma(u), \qquad u\in\mathcal{A}. \tag{1.6} \]

При выпуклой $\Gamma(u)$ spurious correlation ограничена сверху нулём с вероятностью $\geq 1-\delta$:

\[ J(\hat u; G^\star) - \hat J(\hat u; \hat G) \leq 0. \tag{1.7} \]

Субоптимальность сводится к intrinsic uncertainty. Uncertainty quantifier через границы $\|\hat G-G^\star\|_{V_{N,\lambda}}$ из раздела оценки:

\[ \Gamma(u) = \mathbb{E}[\ell_1(V_{N,\lambda}, u)], \qquad \ell_1(V_{N,\lambda}, u) := C(N)\,\|V_{N,\lambda}^{-1/2} u\|, \tag{1.8} \]

Оптимизатор $\hat J$ — pessimistic optimal strategy $u^{(1)}$. Первое применение pessimistic offline RL в количественных финансах и непрерывном стохастическом управлении.

Основные результаты по RL:

Структура статьи: раздел 2 — модель и основные результаты (Theorems 2.10, 2.14, 2.18, 2.23); раздел 3 — численные иллюстрации; раздел 4 — математические основы сходимости оценщиков; разделы 5–7 — доказательства; Appendix A — примеры pessimistic RL; Appendix B — дополнительные численные эксперименты.

2. Постановка задачи и основные результаты

2.1. Модель оптимальной ликвидации

Фиксируем $T>0$ и равномерное разбиение $[0,T]$: $\mathcal{T}=\{0=t_1,\ldots,t_M=T\}$. На фильтрованном пространстве $(\Omega,\mathcal{F},\mathbb{F}=\{\mathcal{F}_{t_i}\}_{i=1}^M,P)$ заданы $\mathcal{F}$-адаптированные процессы $(A_{t_i})$, $(\varepsilon_{t_i})$ с конечными вторыми моментами и $\mathbb{E}[\varepsilon_{t_i}\mid\mathcal{F}_{t_{i-1}}]=0$. Трейдер с целевой позицией $x_0\in\mathbb{R}$ акций; инвентарь $X_{t_n}=\sum_{i=1}^n u_{t_i}$; скорость торговли $u=(u_{t_1},\ldots,u_{t_M})^\top$ из множества допустимых стратегий

\[ \mathcal{A} = \Bigl\{(u_{t_i})_{i=1}^M \text{ $\mathcal{F}$-adapted},\ \mathbb{E}[u_{t_i}^2]<\infty\Bigr\}, \tag{2.1} \]

с fuel constraint $\sum_{i=1}^M u_{t_i}=x_0$. Матрица пропагатора $G=(G_{i,j})$ удовлетворяет

\[ \sum_{i,j=1}^{M}(G_{i,j}+G_{j,i})\,x_j x_i > 0\ \forall x\in\mathbb{R}^M, \qquad G_{i,j}=0\ \text{при}\ 1\leq iЦена исполнения с транзиентным impact:

\[ S_{t_{i+1}} = S_{t_1} + \sum_{j=1}^{i} G_{i,j}\, u_{t_j} + A_{t_i} + \varepsilon_{t_i}, \qquad i=1,\ldots,M. \tag{2.3} \]

Функционал издержек:

\[ J(u; G) = \mathbb{E}\left[\sum_{i=1}^{M}\sum_{j=1}^{i} G_{i,j}\, u_{t_j}\, u_{t_i} + \sum_{i=1}^{M} A_{t_i}\, u_{t_i}\right]. \tag{2.4} \]

Задача оптимизации:

\[ \min_{u\in\mathcal{A}} J(u; G) \quad \text{s.t.}\ \sum_{i=1}^{M} u_{t_i} = x_0. \tag{2.5} \]

Обозначения. $2\eta>0$ — наименьшее собственное значение $G+G^\top$; разложение $G=\eta I_M+\tilde G$ (2.6)–(2.7). Векторы $1=(1,\ldots,1)^\top$, $A=(A_{t_1},\ldots,A_{t_M})^\top$. Матрицы $D^{(\ell)}$, $K$ — (2.8)–(2.9).

Теорема 2.1. Существует единственная допустимая стратегия, решающая (2.5):

\[ u_{t_i} = \sum_{j\leq i} \bigl((2\eta I_M + K)^{-1}\bigr)_{i,j}\,\bigl(g_{t_j} + a_{t_j}\,\mathbb{E}_{t_j}[\lambda]\bigr), \qquad i=1,\ldots,M, \tag{2.10} \]

с коэффициентами $g_{t_j}$, $a_{t_j}$, множителем Лагранжа $\lambda$ и вспомогательными величинами $b_r$, $c_r$, $h_r$, $e_{t_i}^A$ — см. оригинал. Доказательство — раздел 7.

Remark 2.2. При $A\equiv 0$ задача сводится к детерминированной постановке Alfonsi et al. [5]: $u^\star = x_0 (G+G^\top)^{-1}1 / (1^\top(G+G^\top)^{-1}1)$.

Remark 2.3. Доказательство обобщает [2, 3]: стохастический множитель Лагранжа для ограничений; решение без регуляризации $\lambda u_{t_i}$ в (2.3) — пропагатор в исходной форме [9].

2.2. Основные результаты по оценке price impact с offline-данными

Определение 2.4 (Offline dataset). $N$ эпизодов; датасет

\[ D = \Bigl\{\bigl(S^{(n)}_{t_i}\bigr)_{i=1}^{M+1}, (u^{(n)}_{t_i})_{i=1}^{M}, (A^{(n)}_{t_i})_{i=1}^{M} \mid n=1,\ldots,N\Bigr\}, \]

где $(S^{(n)}, u^{(n)}, A^{(n)})_{n=1}^N$ — реализации на $(\Omega',\mathcal{F}',P')$: для каждого $n$, $u^{(n)}$ измерима относительно $\mathcal{G}_{n-1}=\sigma((S^{(k)},u^{(k)},A^{(k)})_{k=1}^{n-1}, (A^{(k)})_{k=1}^n)$; существуют $\mathcal{G}_n$-измеримые $\varepsilon^{(n)}$ такие, что

\[ S^{(n)}_{t_{i+1}} - S^{(n)}_{t_1} = \sum_{j=1}^{i} G^\star_{i,j}\, u^{(n)}_{t_j} + A^{(n)}_{t_i} + \varepsilon^{(n)}_{t_i}, \qquad \mathbb{E}_{P'}[\varepsilon^{(n)}_{t_i}\mid\mathcal{G}_{n-1}]=0. \tag{2.11} \]

Remark 2.5. Допускаются зависимые адаптивные стратегии $u^{(n)}$, не обязательно оптимизирующие (2.4) — релевантно для crowded markets [15, 31, 33].

Класс допустимых пропагаторов $G_{\mathrm{ad}}$ (2.14): $x^\top(G+G^\top)x\geq\kappa\|x\|^2$; $G_{i,j}\geq 0$; нижняя треугольная структура (неanticipative). Примеры Volterra-ядер — Remark 2.7 (облигации [11], time-varying liquidity [19]).

Assumption 2.8. Шум $\varepsilon^{(n)}$ $R$-условно sub-Gaussian относительно $\mathcal{G}_{n-1}$:

\[ \mathbb{E}_{P'}\bigl[\exp(\langle v,\varepsilon^{(n)}\rangle)\mid\mathcal{G}_{n-1}\bigr] \leq \exp\!\Bigl(\tfrac{R\|v\|^2}{2}\Bigr), \quad \forall v\in\mathbb{R}^M. \]

МНК-оценка:

\[ G_{N,\lambda} := \arg\min_{G\in G_{\mathrm{ad}}} \sum_{n=1}^{N} \|y^{(n)} - G u^{(n)}\|^2 + \lambda\|G\|_{\mathbb{R}^{M\times M}}^2, \tag{2.16} \]

где $y^{(n)}_{t_i} = S^{(n)}_{t_{i+1}}-S^{(n)}_{t_1}-A^{(n)}_{t_i}$, т.е. $y^{(n)}=G^\star u^{(n)}+\varepsilon^{(n)}$ (2.15). Регуляризация $\lambda>0$ обеспечивает strong convexity и инvertibility (Remark 2.9). Вычисление: проекция некonstrained оценщика $\tilde G_{N,\lambda}$ (2.17)–(2.19) на $G_{\mathrm{ad}}$ с весовой матрицей

\[ V_{N,\lambda} = \sum_{n=1}^{N} u^{(n)}(u^{(n)})^\top + \lambda I_M. \tag{2.18} \]

Теорема 2.10. При $G^\star\in G_{\mathrm{ad}}$ и Assumption 2.8, с $P'$-вероятностью $\geq 1-\delta$:

\[ \|(G_{N,\lambda}-G^\star)V_{N,\lambda}^{1/2}\|_{\mathbb{R}^{M\times M}} \leq R\log\!\Bigl(\tfrac{\lambda^{-M}\det(V_{N,\lambda})^M}{\delta^2}\Bigr)^{1/2} + \lambda^{1/2}\|G^\star V_{N,\lambda}^{-1/2}\|_{\mathbb{R}^{M\times M}}. \tag{2.20} \]

Remark 2.11. Существенное улучшение [34, Theorem 2.10]: general Volterra, correlated observations, произвольные $u^{(n)}$.

Convolution case. Структура (2.21)–(2.22): $G^\star_{i,j}=K^\star_{i-j}$; класс $K_{\mathrm{ad}}$ — монотонное убывание/convexity дискретного ядра. Примеры: power-law $K(t)=\ell_0/(\ell_0+t)^\beta$ [9, 20]; $K(t)=t^\beta$ при $0<\beta<1/2$ [20]; экспонента $e^{-\rho t}$ [35]. Оценка $K_{N,\lambda}$ — (2.25)–(2.28) через матрицы $U_n$ (2.24).

Теорема 2.14. При $K^\star\in K_{\mathrm{ad}}$ и Assumption 2.8, с вероятностью $\geq 1-\delta$:

\[ \|W_{N,\lambda}^{1/2}(K_{N,\lambda}-K^\star)\| \leq R\log\!\Bigl(\tfrac{\lambda^{-M}\det(W_{N,\lambda})^M}{\delta^2}\Bigr)^{1/2} + \lambda^{1/2}\|W_{N,\lambda}^{-1/2}K^\star\|, \tag{2.29} \]

где $W_{N,\lambda}=\sum_n U_n^\top U_n + \lambda I_M$. Remark 2.15: лучшая зависимость от $M$ по сравнению с (2.20); см. Figure 1.

Истинный power-law пропагатор и относительные ошибки оценщиков
Рис. 1. Истинный power-law пропагатор $G^\star(t)=0.01(t+1)^{-0.4}$ (слева) и относительные ошибки Volterra-оценщика (справа) и convolution-оценщика (снизу).

2.3. Пессимистичное проектирование управления с offline-данными

Продуктовое пространство $(\Omega,\mathcal{F},P)=(\Omega'\times\Omega,\mathcal{F}'\times\mathcal{F},P'\times P)$; $P_D$ — условная мера при фиксированном $D$; $\mathbb{E}_D$ — условное матожидание. Ограниченные классы:

\[ \mathcal{A}_b = \{u\in\mathcal{A}: \|u\|\leq L_{\mathrm{(2.30)}}^{\mathcal{A}}\}, \qquad G_b = \{G\in G_{\mathrm{ad}}: \|G\|\leq L_{\mathrm{(2.30)}}^{G}\}. \tag{2.30} \]

Штраф Volterra:

\[ \ell_1(V_{N,\lambda}, u) := L_{\mathrm{(2.30)}}^{\mathcal{A}}\, C_{\mathrm{(2.32)}}(N)\,\|V_{N,\lambda}^{-1/2} u\|, \tag{2.31} \]

где $C_{\mathrm{(2.32)}}(N)$ из границы Theorem 2.10 (2.32). Пессимистичный функционал:

\[ J_{P,1}(u; G_{N,\lambda}) := \mathbb{E}_D\!\left[\sum_{i,j} (G_{N,\lambda})_{i,j}\, u_{t_j} u_{t_i} + \sum_i A_{t_i} u_{t_i} + \ell_1(V_{N,\lambda}, u)\right]. \tag{2.34} \]

Для convolution — штраф $\ell_2(W_{N,\lambda}, u)$ через матрицу $U$ (2.35)–(2.39) и $J_{P,2}(u; K_{N,\lambda})$ (2.39). Пессимистичные задачи (2.40): $\min_{u\in\mathcal{A}_b} J_{P,i}(u; G_{N,\lambda})$ s.t. $\sum_i u_{t_i}=x_0$. Remark 2.17: unique minimizer при достаточно большом $L_{\mathrm{(2.30)}}^{\mathcal{A}}$ — strong convexity [8, Lemma 2.33].

2.4. Основные результаты о производительности пессимистичных стратегий

Теорема 2.18. Пусть $\hat u^{(i)}$ — минимизатор $J_{P,i}(u; G_{N,\lambda})$, $i=1,2$. При Assumption 2.8, с $P'$-вероятностью $\geq 1-\delta$:

  • (i) Volterra: $J(\hat u^{(1)}; G^\star) - J(u; G^\star) \leq 2\mathbb{E}_D[\ell_1(V_{N,\lambda}, u)]$ для всех $u\in\mathcal{A}_b$.
  • (ii) Convolution: $J(\hat u^{(2)}; G^\star) - J(u; G^\star) \leq 2\mathbb{E}_D[\ell_2(W_{N,\lambda}, u)]$ для всех $u\in\mathcal{A}_b$.

Corollary 2.19. $\Gamma(u)=\mathbb{E}[\ell_i(\cdot,u)]$ — $\delta$-uncertainty quantifier в смысле Definition 1.1.

Definition 2.20 (порядок Loewner). $A\leq B$ для симметричных $A,B$, если $x^\top(B-A)x\geq 0$ для всех $x$.

Assumption 2.21 (well-explored dataset). С вероятностью $\geq 1-\delta$:

  • (i) Volterra: $\bigl|\tfrac{1}{N}\sum_n u^{(n)}(u^{(n)})^\top - \Sigma\bigr| \leq C_{\mathrm{2.21}}(\delta)/\sqrt{N}\, I_M$.
  • (ii) Convolution: $\bigl|\tfrac{1}{N}\sum_n U_n^\top U_n - \hat\Sigma\bigr| \leq C_{\mathrm{2.21}}(\delta)/\sqrt{N}\, I_M$.

Remark 2.22. Для convolution Assumption 2.21(ii) естественна: $U_n^\top U_n$ положительно определена при $u^{(n)}_{t_1}\neq 0$ — выполняется с вероятностью $\to 1$ при большом $N$. Для Volterra нужно $N\gg M$ (ранг-1 матрицы $u^{(n)}(u^{(n)})^\top$).

Теорема 2.23. При $\lambda = C_{\mathrm{2.21}}(\delta) N^{1/2}$ и Assumptions 2.8, 2.21, с $P'$-вероятностью $\geq 1-2\delta$:

\[ J(\hat u^{(1)}; G^\star) - J(u; G^\star) \leq \tfrac{1}{\sqrt{N}}\bigl(C_1(M,\delta,\Sigma,N) + C_2(M,\delta,\Sigma)\bigr), \]

где $C_1(N)=O(\sqrt{\log N})$, $C_2=O(1)$ — явные константы (2.32)–(2.38). Аналогично для convolution с $\hat\Sigma$. SubOpt $= O(N^{-1/2}(\log N)^{1/2})$ — sharp до log; совместимо с Corollary 4.5 [25] для linear MDP.

Remark 2.24–2.26. Framework эффективен при бедном датасете. Связь с robust finance: «радиус» непараметрических моделей задаётся нормами $V_{N,\lambda}^{-1/2}$, $W_{N,\lambda}^{-1/2}$ из данных, а не гиперпараметром. См. Figure 3.

3. Численная иллюстрация

На синтетическом датасете иллюстрируются:

  • Прямая оценка Volterra (2.16) даёт большие ошибки без достаточно «шумных» стратегий; convolution-структура (2.25) резко улучшает точность.
  • Жадная стратегия на $\hat G$ чувствительна к качеству оценки; пессимистичная стратегия стабильна и снижает издержки.

Конструкция данных. $N=252$ торговых дней; $M=78$ бинов по 5 мин (6.5 ч). Не затронутая цена: $dP_t = I_t\,dt + \sigma_P\,dW_t^P$; сигнал $I$ — Ornstein–Uhlenbeck (3.1); $A_{t_i}=\int_0^{t_i} I_u\,du$. Три типа трейдеров с равными весами, buy-only, $x_0\sim\mathrm{Unif}[500,2000]$:

  • TWAP: $u^1_{t_i}=x_0/M$.
  • Obizhaeva–Wang [35]: $u^2 = x_0 (G+G^\top)^{-1}1 / (1^\top(G+G^\top)^{-1}1)$ с $G_{i,j}=\hat\kappa e^{-\hat\rho(t_i-t_j)}\mathbf{1}_{\{i\geq j\}}$, $\hat\rho,\hat\kappa$ случайны вокруг истинных.
  • Trend-following [27]: $u^3_{t_i} = \tfrac{I_{t_i}}{2\hat\mu\hat\kappa}(1-e^{-\hat\mu(T-t_i)})$.
Таблица 1. Параметры модели.
ПараметрЗначение
Волатильность цены $\sigma_P$0.0088
Волатильность сигнала $\sigma$0.06
Mean reversion сигнала $\mu$0.1
Trading cost $\kappa$0.01
Resilience $\rho$0.04

Истинный пропагатор — power-law (3.3) или экспонента (3.4). Оценщики: (2.18), (2.26) с $\lambda=10^{-3}$, проекция через CVXPY [17].

Figure 1: Volterra-оценщик (2.18) даёт большие component-wise ошибки на «структурированном» датасете; convolution (2.26) восстанавливает ядро точно (Figure 2). Относительные ошибки:

\[ \mathrm{err}^{(i)} := \max_{j\in\{1,\ldots,M\}} \frac{|K^{\star,(i)}_j - (\tilde K_{N,\lambda})_j|}{K^{\star,(i)}_j}, \qquad \mathrm{err}^{(i)}_{\mathrm{proj}} := \max_j \frac{|K^{\star,(i)}_j - (K_{N,\lambda})_j|}{K^{\star,(i)}_j}. \]
Таблица 2. Точность convolution-оценщиков (2.26) и (2.27) для разных $N$.
$N$Power-law $\mathrm{err}^{(1)}$$\mathrm{err}^{(1)}_{\mathrm{proj}}$Exp $\mathrm{err}^{(2)}$$\mathrm{err}^{(2)}_{\mathrm{proj}}$
63$8.4\times 10^{-3}$$1.9\times 10^{-3}$$9.8\times 10^{-3}$$4.4\times 10^{-3}$
126$6.9\times 10^{-3}$$1.7\times 10^{-3}$$5.3\times 10^{-3}$$2.9\times 10^{-3}$
252$4.2\times 10^{-3}$$1.2\times 10^{-3}$$4.2\times 10^{-3}$$2.2\times 10^{-3}$
Сравнение истинных и оценённых ядер price impact
Рис. 2. Сравнение истинных ядер $K(t)=\kappa(t+1)^{-\beta}$ (верх) и $K(t)=\kappa e^{-\rho t}$ (низ) с оценками (2.26); $N=252$.

Торговые стратегии. Power-law kernel, $\kappa=0.01$, $\beta^\star=0.4$, $N=252$, нулевой сигнал. Сравниваются: оптимальная (Theorem 2.1, $G^\star$), жадная (Theorem 2.1, $G_{N,\lambda}$ из (2.16)), пессимистичная (минимум (2.34)). Жадная стратегия осциллирует из-за шума в оценщике; пессимистичная сглаживает (Figure 3).

Скорости торговли и инвентари стратегий
Рис. 3. Скорости торговли (слева) и инвентари (справа): оптимальная (зелёная), жадная (синяя), пессимистичная (оранжевая).
Таблица 3. Издержки ликвидации.
Тип стратегииИздержки
Оптимальная ($G^\star$)4500.24
Жадная ($G_{N,\lambda}$)5216.68
Пессимистичная ($G_{N,\lambda}$)4537.19

При convolution-оценщике (2.26) жадная и пессимистичная стратегии близки к оптимуму — оценка точна. На практике истинный пропагатор и точность модели неизвестны; пессимистичная стратегия даёт verifiable bound на риск до деплоя.

4. Martingale tail inequality для МНК-оценки

Устанавливается martingale tail inequality для шума в конечномерном гильбертовом пространстве; на её основе — high-probability bounds для МНК при коррелированных наблюдениях. Обобщение [1] с $\mathbb{R}$ на general Hilbert space — для доказательства Theorems 2.10, 2.14.

Definition 4.1. $Z:\Omega\to H$ — $\alpha$-условно sub-Gaussian относительно $\mathcal{G}$, если $\mathbb{E}[\exp(\langle u,Z\rangle_H)\mid\mathcal{G}] \leq \exp(\alpha^2\|u\|_H^2/2)$.

Фиксируем гильбертовы пространства $X,Y$; $(A_i)$ — $L^2(X,Y)$-процесс, предсказуемый относительно фильтрации $\mathcal{G}$; $(\eta_i)$ — адаптированный шум с $\mathbb{E}[\eta_i\mid\mathcal{G}_{i-1}]=0$, sub-Gaussian. Процессы $M_n=\sum_{i=1}^n A_i^* A_i$, $U_n=\sum_{i=1}^n A_i^*\eta_i$ — (4.2)–(4.3).

Theorem 4.2. Для всех $V\in S_+(X)$, $\delta\in(0,1)$:

\[ \mathbb{P}\!\Bigl(\|U_n\|_{X,(M_n+V)^{-1}}^2 \leq 2\alpha^2 \log\!\tfrac{\sqrt{\det(V^{-1}M_n+\mathrm{id}_X)}}{\delta},\ \forall n\in\mathbb{N}\Bigr) \geq 1-\delta. \]

Lemma 4.3, Proposition 4.4, Theorem 4.5 — вспомогательные результаты; Theorem 4.5 даёт high-probability bound для general least-squares с коррелированными наблюдениями. Доказательства — раздел 5.

5–7. Доказательства основных результатов

Раздел 5 — доказательство Theorems 2.10, 2.14 через Theorem 4.5 и проекцию на $G_{\mathrm{ad}}$, $K_{\mathrm{ad}}$.

Раздел 6 — доказательство Theorems 2.18, 2.23 и Corollary 2.19: декомпозиция regret; $\ell_i$ как $\delta$-uncertainty quantifier; оценка $\mathbb{E}_D[\ell_i]$ через Assumption 2.21 и границы оценки пропагатора; выбор $\lambda=C_{\mathrm{2.21}}(\delta)N^{1/2}$.

Раздел 7 — доказательство Theorem 2.1: стохастический множитель Лагранжа для fuel constraint; рекурсия для $\mathbb{E}_{t_r}[\lambda]$; обратимость матриц $D^{(\ell)}$ (Lemma 7.1). Методы обобщают [2, 3] на constrained non-Markovian control.

Приложение A. Иллюстративные примеры

Example A.1 (Spurious correlation). Недооценка impact: $G^\star - \hat G \succ \Delta I_M$. Тогда

\[ \mathrm{SpurCor} = J(\hat u; G^\star) - J(\hat u; \hat G) = \mathbb{E}[\langle(G^\star-\hat G)\hat u, \hat u\rangle] \geq \Delta\,\mathbb{E}[\|\hat u\|^2]. \]

Временный impact: $\hat G=\hat\kappa I_M$, $G^\star=\kappa I_M$, $0<\hat\kappa<\kappa$. Наблюдаемая цена $P_t=\mu t + \sigma W_t$. Оптимальная непрерывная стратегия [12]: $u_t^\star = x_0/T + \mu(T-2t)/(4\kappa)$. При $\kappa\approx 10^{-10}$, $\mu T\approx 0.02$ (bull market) жадная стратегия на $\hat\kappa$ торгует быстрее → усиление издержек порядка $(\kappa/\hat\kappa)^2$. Пессимистичная стратегия $u^{(1)}$ с $\Gamma(u)=\Delta\int_0^T u_t^2\,dt$ совпадает с $u^\star$ при $\hat\kappa+\Delta=\kappa$.

Example A.2 (Эффект штрафа $\ell_1$). $M=2$, $N$ buy metaorders, $u_1^{(i)}\gg u_2^{(i)}\geq 0$ (типичная структура без сигнала [12]). При $\lambda=1$, $V_{N,1}=\sum_i u^{(i)}(u^{(i)})^\top + I_M$ имеет вид $\begin{pmatrix}a_1&a_2\\ a_2&a_3\end{pmatrix}$ с $0

Приложение B. Оценка Volterra-ядер на шумном датасете

Стратегии $u^{(n)}_{t_i}$ i.i.d. $\mathcal{N}(50,9^2)$; $G^\star_{i,j}=\kappa/(t_i-t_j+1)^\beta$, $\kappa=0.01$, $\beta=0.4$; $\lambda=10^{-3}$, $N=252$, $M=78$. Оценщик (2.16) восстанавливает пропагатор (Figure 4) — при достаточно случайных скоростях торговли Volterra-оценка работает.

Volterra-оценка на шумном датасете
Рис. 4. Истинный пропагатор $G^\star$ (слева), оценка $G_{N,\lambda}$ (справа) и относительная ошибка (снизу) Volterra-оценщика при наблюдении шумных торговых стратегий.

Литература

[1] Y. Abbasi-Yadkori, D. Pál, C. Szepesvári. Improved algorithms for linear stochastic bandits. NeurIPS, 24, 2011.

[2] E. Abi Jaber, E. Neuman. Optimal liquidation with signals: the general propagator case. arXiv:2211.00447, 2022.

[3] E. Abi Jaber, E. Neuman, M. Voss. Equilibrium in functional stochastic games with mean-field interaction. arXiv:2306.05433, 2023.

[4] A. Alfonsi, A. Schied. Capacitary measures for completely monotone kernels via singular control. SIAM J. Control Optim., 51(2):1758–1780, 2013.

[5] A. Alfonsi, A. Schied, A. Slynko. Order book resilience, price manipulation, and the positive portfolio problem. SIAM J. Financial Math., 3(1):511–533, 2012.

[6] R. Almgren, N. Chriss. Value under liquidation. Risk, 12:61–63, 1999.

[7] R. Almgren, N. Chriss. Optimal execution of portfolio transactions. J. Risk, 3(2):5–39, 2000.

[8] J. F. Bonnans, A. Shapiro. Perturbation Analysis of Optimization Problems. Springer, 2013.

[9] J.-P. Bouchaud, Y. Gefen, M. Potters, M. Wyart. Fluctuations and response in financial markets. Quant. Finance, 4(2):176–190, 2004.

[10] J.-P. Bouchaud, J. Bonart, J. Donier, M. Gould. Trades, Quotes and Prices. Cambridge Univ. Press, 2018.

[11] D. Brigo, F. Graceffa, E. Neuman. Price impact on term structure. Quant. Finance, 22(1):171–195, 2022.

[12] Á. Cartea, S. Jaimungal, J. Penalva. Algorithmic and High-Frequency Trading. Cambridge Univ. Press, 2015.

[13] J. Chang, M. Uehara, D. Sreenivas, R. Kidambi, W. Sun. Mitigating covariate shift in imitation learning via offline data with partial coverage. NeurIPS, 34:965–979, 2021.

[14] P. Collin-Dufresne, K. Daniel, M. Saglam. Liquidity regimes and optimal dynamic asset allocation. J. Financial Economics, 136(2):379–406, 2020.

[15] R. Cont, E. Neuman, A. Micheli. Fast and slow optimal trading with exogenous information. arXiv:2210.01901, 2023.

[16] G. Davies. The great bull market reaches its 10th birthday. FT, 2019.

[17] S. Diamond, S. Boyd. CVXPY. JMLR, 17(83):1–5, 2016.

[18] M. Forde, L. Sánchez-Betancourt, B. Smith. Optimal trade execution for Gaussian signals with power-law resilience. Quant. Finance, 22(3):585–596, 2022.

[19] A. Fruth, T. Schöneborn, M. Urusov. Optimal trade execution and price manipulation in order books with time-varying liquidity. Math. Finance, 24:651–695, 2014.

[20] J. Gatheral. No-dynamic-arbitrage and market impact. Quant. Finance, 10(7):749–759, 2010.

[21] J. Gatheral, A. Schied, A. Slynko. Exponential resilience and decay of market impact. In Econophysics of Order-driven Markets, 2011.

[22] J. Gatheral, A. Schied, A. Slynko. Transient linear price impact and Fredholm integral equations. Math. Finance, 22(3):445–474, 2012.

[23] I. Gohberg, S. Goldberg, M. A. Kaashoek. Classes of Linear Operators, Vol. I. Birkhäuser, 1990.

[24] N. Jegadeesh. Evidence of predictable behavior of security returns. J. Finance, 45(3):881–898, 1990.

[25] Y. Jin, Z. Yang, Z. Wang. Is pessimism provably efficient for offline RL? ICML, 5084–5096. PMLR, 2021.

[26] R. Kidambi, A. Rajeswaran, P. Netrapalli, T. Joachims. MOReL: Model-based offline reinforcement learning. NeurIPS, 33:21810–21823, 2020.

[27] C. A. Lehalle, E. Neuman. Incorporating signals into optimal trading. Finance and Stochastics, 23(2):275–311, 2019.

[28] J. Li, C. Tang, M. Tomizuka, W. Zhan. Dealing with the unknown: Pessimistic offline reinforcement learning. arXiv:2111.05440, 2021.

[29] A. Madhavan. The Russell reconstitution effect. Financial Analysts J., 59(4):51–64, 2003.

[30] A. Micheli, E. Neuman. Evidence of crowding on Russell 3000 reconstitution events. Market Microstructure and Liquidity, 2022.

[31] A. Micheli, J. Muhle-Karbe, E. Neuman. Closed-loop Nash competition for liquidity. Math. Finance, 2023.

[32] E. Neuman, M. Voss. Optimal signal-adaptive trading with temporary and transient price impact. SIAM J. Financial Math., 13(2):551–575, 2022.

[33] E. Neuman, M. Voss. Trading with the crowd. Math. Finance, 33(3):548–617, 2023.

[34] E. Neuman, Y. Zhang. Statistical learning with sublinear regret of propagator models. arXiv:2301.05157, 2023.

[35] A. A. Obizhaeva, J. Wang. Optimal trading strategy and supply/demand dynamics. J. Financial Markets, 16(1):1–32, 2013.

[36] N. Randewich. Wall Street's oldest-ever bull market turns 10 years old. Reuters, 2019.

[37] W. S. J. Staff. Inside a Decade-long Bull Run. Wall Street Journal, 2019.

[38] B. Tóth, Z. Eisler, J. P. Bouchaud. The short-term price impact of trades is universal. Market Microstructure and Liquidity, 03(02):1850002, 2017.

[39] M. Uehara, W. Sun. Pessimistic model-based offline reinforcement learning under partial coverage. arXiv:2107.06226, 2021.

[40] M. Vodret, I. Mastromatteo, B. Tóth, M. Benzaquen. Do fundamentals shape the price response? A critical assessment of linear impact models. Quant. Finance, 22(12):2139–2150, 2022.