Offline-подход к обучению моделей пропагатора
Eyal Neuman, Wolfgang Stockinger, Yufei Zhang · Department of Mathematics, Imperial College London · 7 сентября 2023
Оригинал: Neuman, E., Stockinger, W. and Zhang, Y. «An Offline Learning Approach to Propagator Models», v1 — arxiv.org/abs/2309.02994 (PDF, 43 стр.).
Рис. 1–4 воспроизведены из оригинальной публикации. Оригинал распространяется по лицензии CC BY 4.0; перевод выполнен на её условиях, изменение по отношению к оригиналу — перевод на русский язык.
MSC (2010): 62L05, 60H30, 91G80, 68Q32, 93C73, 93E35, 62G08 · JEL: C02, C61, G11
Ключевые слова: optimal portfolio liquidation, price impact, propagator models, predictive signals, Volterra stochastic control, offline reinforcement learning, nonparametric estimation, pessimistic principle, regret analysis.
Аннотация
Рассматривается offline-задача обучения: агент сначала оценивает неизвестное ядро ценового воздействия (price impact kernel) по статическому датасету, а затем проектирует стратегии ликвидации рискованного актива с транзиентным price impact. Предложен новый подход к непараметрической оценке пропагатора по данным, содержащим коррелированные ценовые траектории, торговые сигналы и метаордера. Точность оценённого пропагатора количественно характеризуется метрикой, явно зависящей от качества датасета.
Показано, что трейдер, минимизирующий издержки исполнения жадной стратегией, построенной только на оценённом пропагаторе, сталкивается с субоптимальностью из-за ложной корреляции (spurious correlation) между торговой стратегией и оценщиком, а также из-за внутренней неопределённости (intrinsic uncertainty), обусловленной смещённым функционалом издержек. В духе offline reinforcement learning вводится пессимистичный функционал потерь, учитывающий неопределённость оценки пропагатора, и оптимизатор, устраняющий ложную корреляцию; получена асимптотически оптимальная верхняя оценка издержек исполнения даже без точного знания истинного пропагатора. Численные эксперименты демонстрируют эффективность предложенного оценщика и пессимистичной торговой стратегии.
1. Введение
Price impact — эмпирический факт, что исполнение крупного ордера неблагоприятно и устойчиво сдвигает цену актива, ухудшая условия для трейдера. Точная оценка price impact транзакций критична для прибыльных стратегий. Модели пропагатора (propagator models) — центральный инструмент математического описания этих явлений (Bouchaud et al. [9], Gatheral [20]): ценовые движения выражаются через влияние прошлых сделок и дают надёжное reduced-form представление реакции limit order book на исполнение.
Агент, ликвидирующий крупный ордер, обычно дробит метаордер на дочерние ордера $\{u_{t_j}: 0=t_1<\ldots где $A+\varepsilon$ — фундаментальная (не затронутая сделками) цена; $A$ — торговый сигнал, $\varepsilon$ — шум с нулевым средним. Элементы $G_{i,j}$ обычно затухают при $j\gg i$ — сумма справа называется транзиентным price impact. Классический пример Almgren–Chriss: если все элементы $G$ схожи, сумма описывает постоянный impact; при $G=\lambda I$ — временный impact. Трейдер наблюдает видимую цену $S$, собственные сделки $u$ и сигнал $A$. Для количественной оценки impact и проектирования стратегии нужна точная оценка $G$. Оценщики для свёрточного случая ($G_{i,j}=G_{i-j}$) предложены в [9, 18, 38, 40] и гл. 13.2 [10]; регрессионные методы распространены в индустрии, но игнорируют ill-posedness МНК, зависимости между траекториями и ложные корреляции между оценщиком и жадными стратегиями — сходимость и скорости остаются открытой проблемой. В [34] предложен непараметрический подход для непрерывного аналога (1.1) с острыми границами скорости сходимости, зависящими от сингулярности пропагатора; оценка была рассчитана на online RL, где агент торгует в среде. Недостатки [34]: стратегия должна быть похожей и детерминированной во всех эпизодах; ценовые траекторы предполагались независимыми — неприменимо на переполненных рынках с общими сигналами [33]. Главное: online-обучение для ликвидации портфеля дорого — один sample path $(S,u,A)$ требует исполнения по субоптимальной стратегии. Большинство калибровок пропагатора делают offline; fine-tuning — online. Цели работы: Датасет $D$ из $N$ траекторий цен, сигналов и метаордеров: Вклад в оценку пропагатора (теоремы 2.10, 2.14): ослабление независимости траекторий (условная sub-Gaussianность шума, Assumption 2.8); допустимы любые price-adaptive стратегии $u^{(n)}$; оценка неконvolution пропагаторов; для convolution — существенно более быстрая сходимость (Remark 2.15); новая норма количественно связывающая ошибку оценки с качеством датасета и играющая ключевую роль в пессимистичном offline RL. $V_{N,\lambda}$ измеряет ковариацию $u^{(n)}$ в $D$ (см. (2.18)). Функционал издержек исполнения объёма $x_0$ на $[0,T]$: где $u=(u_{t_i})_{i=1}^M$ удовлетворяет fuel constraint $\sum_i u_{t_i}=x_0$. Двухшаговая процедура «оценка $G$ → жадная оптимизация $J(u;\hat G)$» попадает в рамки offline RL с патологическими эффектами: Обозначения: $(G^\star, u^\star, J)$ — истинный пропагатор, оптимальная стратегия и функционал (1.4); $(\hat G, \hat u, \hat J)$ — оценка ядра, выпуклый функционал на $\hat G$ и жадная стратегия. Субоптимальность: Декомпозиция (по аналогии с Lemma 3.1 [25]): Член (i) наиболее труден: $\hat u$, $\hat G$ и $\hat J$ одновременно зависят от $D$. Example A.1 (Appendix A) показывает существенную субоптимальность жадной стратегии. Член (ii) проще — $u^\star$ не зависит от $D$. Член (iii) $\leq 0$ при жадности $\hat u$. Для минимизации субоптимальности — пессимистичный offline RL framework. Ключевое понятие — $\delta$-uncertainty quantifier: Определение 1.1 ($\delta$-uncertainty quantifier). $\Gamma: \mathcal{A}\to\mathbb{R}_+$ — $\delta$-uncertainty quantifier относительно $P'$ (мера, порождающая датасет), если событие удовлетворяет $P'(A)\geq 1-\delta$ для $\delta\in(0,1)$. Кандидат для $\hat J$, устраняющий ложную корреляцию: При выпуклой $\Gamma(u)$ spurious correlation ограничена сверху нулём с вероятностью $\geq 1-\delta$: Субоптимальность сводится к intrinsic uncertainty. Uncertainty quantifier через границы $\|\hat G-G^\star\|_{V_{N,\lambda}}$ из раздела оценки: Оптимизатор $\hat J$ — pessimistic optimal strategy $u^{(1)}$. Первое применение pessimistic offline RL в количественных финансах и непрерывном стохастическом управлении. Основные результаты по RL: Структура статьи: раздел 2 — модель и основные результаты (Theorems 2.10, 2.14, 2.18, 2.23); раздел 3 — численные иллюстрации; раздел 4 — математические основы сходимости оценщиков; разделы 5–7 — доказательства; Appendix A — примеры pessimistic RL; Appendix B — дополнительные численные эксперименты. Фиксируем $T>0$ и равномерное разбиение $[0,T]$: $\mathcal{T}=\{0=t_1,\ldots,t_M=T\}$. На фильтрованном пространстве $(\Omega,\mathcal{F},\mathbb{F}=\{\mathcal{F}_{t_i}\}_{i=1}^M,P)$ заданы $\mathcal{F}$-адаптированные процессы $(A_{t_i})$, $(\varepsilon_{t_i})$ с конечными вторыми моментами и $\mathbb{E}[\varepsilon_{t_i}\mid\mathcal{F}_{t_{i-1}}]=0$. Трейдер с целевой позицией $x_0\in\mathbb{R}$ акций; инвентарь $X_{t_n}=\sum_{i=1}^n u_{t_i}$; скорость торговли $u=(u_{t_1},\ldots,u_{t_M})^\top$ из множества допустимых стратегий с fuel constraint $\sum_{i=1}^M u_{t_i}=x_0$. Матрица пропагатора $G=(G_{i,j})$ удовлетворяет
2. Постановка задачи и основные результаты
2.1. Модель оптимальной ликвидации
Функционал издержек:
\[ J(u; G) = \mathbb{E}\left[\sum_{i=1}^{M}\sum_{j=1}^{i} G_{i,j}\, u_{t_j}\, u_{t_i} + \sum_{i=1}^{M} A_{t_i}\, u_{t_i}\right]. \tag{2.4} \]Задача оптимизации:
\[ \min_{u\in\mathcal{A}} J(u; G) \quad \text{s.t.}\ \sum_{i=1}^{M} u_{t_i} = x_0. \tag{2.5} \]Обозначения. $2\eta>0$ — наименьшее собственное значение $G+G^\top$; разложение $G=\eta I_M+\tilde G$ (2.6)–(2.7). Векторы $1=(1,\ldots,1)^\top$, $A=(A_{t_1},\ldots,A_{t_M})^\top$. Матрицы $D^{(\ell)}$, $K$ — (2.8)–(2.9).
Теорема 2.1. Существует единственная допустимая стратегия, решающая (2.5):
\[ u_{t_i} = \sum_{j\leq i} \bigl((2\eta I_M + K)^{-1}\bigr)_{i,j}\,\bigl(g_{t_j} + a_{t_j}\,\mathbb{E}_{t_j}[\lambda]\bigr), \qquad i=1,\ldots,M, \tag{2.10} \]с коэффициентами $g_{t_j}$, $a_{t_j}$, множителем Лагранжа $\lambda$ и вспомогательными величинами $b_r$, $c_r$, $h_r$, $e_{t_i}^A$ — см. оригинал. Доказательство — раздел 7.
Remark 2.2. При $A\equiv 0$ задача сводится к детерминированной постановке Alfonsi et al. [5]: $u^\star = x_0 (G+G^\top)^{-1}1 / (1^\top(G+G^\top)^{-1}1)$.
Remark 2.3. Доказательство обобщает [2, 3]: стохастический множитель Лагранжа для ограничений; решение без регуляризации $\lambda u_{t_i}$ в (2.3) — пропагатор в исходной форме [9].
2.2. Основные результаты по оценке price impact с offline-данными
Определение 2.4 (Offline dataset). $N$ эпизодов; датасет
\[ D = \Bigl\{\bigl(S^{(n)}_{t_i}\bigr)_{i=1}^{M+1}, (u^{(n)}_{t_i})_{i=1}^{M}, (A^{(n)}_{t_i})_{i=1}^{M} \mid n=1,\ldots,N\Bigr\}, \]где $(S^{(n)}, u^{(n)}, A^{(n)})_{n=1}^N$ — реализации на $(\Omega',\mathcal{F}',P')$: для каждого $n$, $u^{(n)}$ измерима относительно $\mathcal{G}_{n-1}=\sigma((S^{(k)},u^{(k)},A^{(k)})_{k=1}^{n-1}, (A^{(k)})_{k=1}^n)$; существуют $\mathcal{G}_n$-измеримые $\varepsilon^{(n)}$ такие, что
\[ S^{(n)}_{t_{i+1}} - S^{(n)}_{t_1} = \sum_{j=1}^{i} G^\star_{i,j}\, u^{(n)}_{t_j} + A^{(n)}_{t_i} + \varepsilon^{(n)}_{t_i}, \qquad \mathbb{E}_{P'}[\varepsilon^{(n)}_{t_i}\mid\mathcal{G}_{n-1}]=0. \tag{2.11} \]Remark 2.5. Допускаются зависимые адаптивные стратегии $u^{(n)}$, не обязательно оптимизирующие (2.4) — релевантно для crowded markets [15, 31, 33].
Класс допустимых пропагаторов $G_{\mathrm{ad}}$ (2.14): $x^\top(G+G^\top)x\geq\kappa\|x\|^2$; $G_{i,j}\geq 0$; нижняя треугольная структура (неanticipative). Примеры Volterra-ядер — Remark 2.7 (облигации [11], time-varying liquidity [19]).
Assumption 2.8. Шум $\varepsilon^{(n)}$ $R$-условно sub-Gaussian относительно $\mathcal{G}_{n-1}$:
\[ \mathbb{E}_{P'}\bigl[\exp(\langle v,\varepsilon^{(n)}\rangle)\mid\mathcal{G}_{n-1}\bigr] \leq \exp\!\Bigl(\tfrac{R\|v\|^2}{2}\Bigr), \quad \forall v\in\mathbb{R}^M. \]МНК-оценка:
\[ G_{N,\lambda} := \arg\min_{G\in G_{\mathrm{ad}}} \sum_{n=1}^{N} \|y^{(n)} - G u^{(n)}\|^2 + \lambda\|G\|_{\mathbb{R}^{M\times M}}^2, \tag{2.16} \]где $y^{(n)}_{t_i} = S^{(n)}_{t_{i+1}}-S^{(n)}_{t_1}-A^{(n)}_{t_i}$, т.е. $y^{(n)}=G^\star u^{(n)}+\varepsilon^{(n)}$ (2.15). Регуляризация $\lambda>0$ обеспечивает strong convexity и инvertibility (Remark 2.9). Вычисление: проекция некonstrained оценщика $\tilde G_{N,\lambda}$ (2.17)–(2.19) на $G_{\mathrm{ad}}$ с весовой матрицей
\[ V_{N,\lambda} = \sum_{n=1}^{N} u^{(n)}(u^{(n)})^\top + \lambda I_M. \tag{2.18} \]Теорема 2.10. При $G^\star\in G_{\mathrm{ad}}$ и Assumption 2.8, с $P'$-вероятностью $\geq 1-\delta$:
\[ \|(G_{N,\lambda}-G^\star)V_{N,\lambda}^{1/2}\|_{\mathbb{R}^{M\times M}} \leq R\log\!\Bigl(\tfrac{\lambda^{-M}\det(V_{N,\lambda})^M}{\delta^2}\Bigr)^{1/2} + \lambda^{1/2}\|G^\star V_{N,\lambda}^{-1/2}\|_{\mathbb{R}^{M\times M}}. \tag{2.20} \]Remark 2.11. Существенное улучшение [34, Theorem 2.10]: general Volterra, correlated observations, произвольные $u^{(n)}$.
Convolution case. Структура (2.21)–(2.22): $G^\star_{i,j}=K^\star_{i-j}$; класс $K_{\mathrm{ad}}$ — монотонное убывание/convexity дискретного ядра. Примеры: power-law $K(t)=\ell_0/(\ell_0+t)^\beta$ [9, 20]; $K(t)=t^\beta$ при $0<\beta<1/2$ [20]; экспонента $e^{-\rho t}$ [35]. Оценка $K_{N,\lambda}$ — (2.25)–(2.28) через матрицы $U_n$ (2.24).
Теорема 2.14. При $K^\star\in K_{\mathrm{ad}}$ и Assumption 2.8, с вероятностью $\geq 1-\delta$:
\[ \|W_{N,\lambda}^{1/2}(K_{N,\lambda}-K^\star)\| \leq R\log\!\Bigl(\tfrac{\lambda^{-M}\det(W_{N,\lambda})^M}{\delta^2}\Bigr)^{1/2} + \lambda^{1/2}\|W_{N,\lambda}^{-1/2}K^\star\|, \tag{2.29} \]где $W_{N,\lambda}=\sum_n U_n^\top U_n + \lambda I_M$. Remark 2.15: лучшая зависимость от $M$ по сравнению с (2.20); см. Figure 1.
2.3. Пессимистичное проектирование управления с offline-данными
Продуктовое пространство $(\Omega,\mathcal{F},P)=(\Omega'\times\Omega,\mathcal{F}'\times\mathcal{F},P'\times P)$; $P_D$ — условная мера при фиксированном $D$; $\mathbb{E}_D$ — условное матожидание. Ограниченные классы:
\[ \mathcal{A}_b = \{u\in\mathcal{A}: \|u\|\leq L_{\mathrm{(2.30)}}^{\mathcal{A}}\}, \qquad G_b = \{G\in G_{\mathrm{ad}}: \|G\|\leq L_{\mathrm{(2.30)}}^{G}\}. \tag{2.30} \]Штраф Volterra:
\[ \ell_1(V_{N,\lambda}, u) := L_{\mathrm{(2.30)}}^{\mathcal{A}}\, C_{\mathrm{(2.32)}}(N)\,\|V_{N,\lambda}^{-1/2} u\|, \tag{2.31} \]где $C_{\mathrm{(2.32)}}(N)$ из границы Theorem 2.10 (2.32). Пессимистичный функционал:
\[ J_{P,1}(u; G_{N,\lambda}) := \mathbb{E}_D\!\left[\sum_{i,j} (G_{N,\lambda})_{i,j}\, u_{t_j} u_{t_i} + \sum_i A_{t_i} u_{t_i} + \ell_1(V_{N,\lambda}, u)\right]. \tag{2.34} \]Для convolution — штраф $\ell_2(W_{N,\lambda}, u)$ через матрицу $U$ (2.35)–(2.39) и $J_{P,2}(u; K_{N,\lambda})$ (2.39). Пессимистичные задачи (2.40): $\min_{u\in\mathcal{A}_b} J_{P,i}(u; G_{N,\lambda})$ s.t. $\sum_i u_{t_i}=x_0$. Remark 2.17: unique minimizer при достаточно большом $L_{\mathrm{(2.30)}}^{\mathcal{A}}$ — strong convexity [8, Lemma 2.33].
2.4. Основные результаты о производительности пессимистичных стратегий
Теорема 2.18. Пусть $\hat u^{(i)}$ — минимизатор $J_{P,i}(u; G_{N,\lambda})$, $i=1,2$. При Assumption 2.8, с $P'$-вероятностью $\geq 1-\delta$:
- (i) Volterra: $J(\hat u^{(1)}; G^\star) - J(u; G^\star) \leq 2\mathbb{E}_D[\ell_1(V_{N,\lambda}, u)]$ для всех $u\in\mathcal{A}_b$.
- (ii) Convolution: $J(\hat u^{(2)}; G^\star) - J(u; G^\star) \leq 2\mathbb{E}_D[\ell_2(W_{N,\lambda}, u)]$ для всех $u\in\mathcal{A}_b$.
Corollary 2.19. $\Gamma(u)=\mathbb{E}[\ell_i(\cdot,u)]$ — $\delta$-uncertainty quantifier в смысле Definition 1.1.
Definition 2.20 (порядок Loewner). $A\leq B$ для симметричных $A,B$, если $x^\top(B-A)x\geq 0$ для всех $x$.
Assumption 2.21 (well-explored dataset). С вероятностью $\geq 1-\delta$:
- (i) Volterra: $\bigl|\tfrac{1}{N}\sum_n u^{(n)}(u^{(n)})^\top - \Sigma\bigr| \leq C_{\mathrm{2.21}}(\delta)/\sqrt{N}\, I_M$.
- (ii) Convolution: $\bigl|\tfrac{1}{N}\sum_n U_n^\top U_n - \hat\Sigma\bigr| \leq C_{\mathrm{2.21}}(\delta)/\sqrt{N}\, I_M$.
Remark 2.22. Для convolution Assumption 2.21(ii) естественна: $U_n^\top U_n$ положительно определена при $u^{(n)}_{t_1}\neq 0$ — выполняется с вероятностью $\to 1$ при большом $N$. Для Volterra нужно $N\gg M$ (ранг-1 матрицы $u^{(n)}(u^{(n)})^\top$).
Теорема 2.23. При $\lambda = C_{\mathrm{2.21}}(\delta) N^{1/2}$ и Assumptions 2.8, 2.21, с $P'$-вероятностью $\geq 1-2\delta$:
\[ J(\hat u^{(1)}; G^\star) - J(u; G^\star) \leq \tfrac{1}{\sqrt{N}}\bigl(C_1(M,\delta,\Sigma,N) + C_2(M,\delta,\Sigma)\bigr), \]где $C_1(N)=O(\sqrt{\log N})$, $C_2=O(1)$ — явные константы (2.32)–(2.38). Аналогично для convolution с $\hat\Sigma$. SubOpt $= O(N^{-1/2}(\log N)^{1/2})$ — sharp до log; совместимо с Corollary 4.5 [25] для linear MDP.
Remark 2.24–2.26. Framework эффективен при бедном датасете. Связь с robust finance: «радиус» непараметрических моделей задаётся нормами $V_{N,\lambda}^{-1/2}$, $W_{N,\lambda}^{-1/2}$ из данных, а не гиперпараметром. См. Figure 3.
3. Численная иллюстрация
На синтетическом датасете иллюстрируются:
- Прямая оценка Volterra (2.16) даёт большие ошибки без достаточно «шумных» стратегий; convolution-структура (2.25) резко улучшает точность.
- Жадная стратегия на $\hat G$ чувствительна к качеству оценки; пессимистичная стратегия стабильна и снижает издержки.
Конструкция данных. $N=252$ торговых дней; $M=78$ бинов по 5 мин (6.5 ч). Не затронутая цена: $dP_t = I_t\,dt + \sigma_P\,dW_t^P$; сигнал $I$ — Ornstein–Uhlenbeck (3.1); $A_{t_i}=\int_0^{t_i} I_u\,du$. Три типа трейдеров с равными весами, buy-only, $x_0\sim\mathrm{Unif}[500,2000]$:
- TWAP: $u^1_{t_i}=x_0/M$.
- Obizhaeva–Wang [35]: $u^2 = x_0 (G+G^\top)^{-1}1 / (1^\top(G+G^\top)^{-1}1)$ с $G_{i,j}=\hat\kappa e^{-\hat\rho(t_i-t_j)}\mathbf{1}_{\{i\geq j\}}$, $\hat\rho,\hat\kappa$ случайны вокруг истинных.
- Trend-following [27]: $u^3_{t_i} = \tfrac{I_{t_i}}{2\hat\mu\hat\kappa}(1-e^{-\hat\mu(T-t_i)})$.
| Параметр | Значение |
|---|---|
| Волатильность цены $\sigma_P$ | 0.0088 |
| Волатильность сигнала $\sigma$ | 0.06 |
| Mean reversion сигнала $\mu$ | 0.1 |
| Trading cost $\kappa$ | 0.01 |
| Resilience $\rho$ | 0.04 |
Истинный пропагатор — power-law (3.3) или экспонента (3.4). Оценщики: (2.18), (2.26) с $\lambda=10^{-3}$, проекция через CVXPY [17].
Figure 1: Volterra-оценщик (2.18) даёт большие component-wise ошибки на «структурированном» датасете; convolution (2.26) восстанавливает ядро точно (Figure 2). Относительные ошибки:
\[ \mathrm{err}^{(i)} := \max_{j\in\{1,\ldots,M\}} \frac{|K^{\star,(i)}_j - (\tilde K_{N,\lambda})_j|}{K^{\star,(i)}_j}, \qquad \mathrm{err}^{(i)}_{\mathrm{proj}} := \max_j \frac{|K^{\star,(i)}_j - (K_{N,\lambda})_j|}{K^{\star,(i)}_j}. \]| $N$ | Power-law $\mathrm{err}^{(1)}$ | $\mathrm{err}^{(1)}_{\mathrm{proj}}$ | Exp $\mathrm{err}^{(2)}$ | $\mathrm{err}^{(2)}_{\mathrm{proj}}$ |
|---|---|---|---|---|
| 63 | $8.4\times 10^{-3}$ | $1.9\times 10^{-3}$ | $9.8\times 10^{-3}$ | $4.4\times 10^{-3}$ |
| 126 | $6.9\times 10^{-3}$ | $1.7\times 10^{-3}$ | $5.3\times 10^{-3}$ | $2.9\times 10^{-3}$ |
| 252 | $4.2\times 10^{-3}$ | $1.2\times 10^{-3}$ | $4.2\times 10^{-3}$ | $2.2\times 10^{-3}$ |
Торговые стратегии. Power-law kernel, $\kappa=0.01$, $\beta^\star=0.4$, $N=252$, нулевой сигнал. Сравниваются: оптимальная (Theorem 2.1, $G^\star$), жадная (Theorem 2.1, $G_{N,\lambda}$ из (2.16)), пессимистичная (минимум (2.34)). Жадная стратегия осциллирует из-за шума в оценщике; пессимистичная сглаживает (Figure 3).
| Тип стратегии | Издержки |
|---|---|
| Оптимальная ($G^\star$) | 4500.24 |
| Жадная ($G_{N,\lambda}$) | 5216.68 |
| Пессимистичная ($G_{N,\lambda}$) | 4537.19 |
При convolution-оценщике (2.26) жадная и пессимистичная стратегии близки к оптимуму — оценка точна. На практике истинный пропагатор и точность модели неизвестны; пессимистичная стратегия даёт verifiable bound на риск до деплоя.
4. Martingale tail inequality для МНК-оценки
Устанавливается martingale tail inequality для шума в конечномерном гильбертовом пространстве; на её основе — high-probability bounds для МНК при коррелированных наблюдениях. Обобщение [1] с $\mathbb{R}$ на general Hilbert space — для доказательства Theorems 2.10, 2.14.
Definition 4.1. $Z:\Omega\to H$ — $\alpha$-условно sub-Gaussian относительно $\mathcal{G}$, если $\mathbb{E}[\exp(\langle u,Z\rangle_H)\mid\mathcal{G}] \leq \exp(\alpha^2\|u\|_H^2/2)$.
Фиксируем гильбертовы пространства $X,Y$; $(A_i)$ — $L^2(X,Y)$-процесс, предсказуемый относительно фильтрации $\mathcal{G}$; $(\eta_i)$ — адаптированный шум с $\mathbb{E}[\eta_i\mid\mathcal{G}_{i-1}]=0$, sub-Gaussian. Процессы $M_n=\sum_{i=1}^n A_i^* A_i$, $U_n=\sum_{i=1}^n A_i^*\eta_i$ — (4.2)–(4.3).
Theorem 4.2. Для всех $V\in S_+(X)$, $\delta\in(0,1)$:
\[ \mathbb{P}\!\Bigl(\|U_n\|_{X,(M_n+V)^{-1}}^2 \leq 2\alpha^2 \log\!\tfrac{\sqrt{\det(V^{-1}M_n+\mathrm{id}_X)}}{\delta},\ \forall n\in\mathbb{N}\Bigr) \geq 1-\delta. \]Lemma 4.3, Proposition 4.4, Theorem 4.5 — вспомогательные результаты; Theorem 4.5 даёт high-probability bound для general least-squares с коррелированными наблюдениями. Доказательства — раздел 5.
5–7. Доказательства основных результатов
Раздел 5 — доказательство Theorems 2.10, 2.14 через Theorem 4.5 и проекцию на $G_{\mathrm{ad}}$, $K_{\mathrm{ad}}$.
Раздел 6 — доказательство Theorems 2.18, 2.23 и Corollary 2.19: декомпозиция regret; $\ell_i$ как $\delta$-uncertainty quantifier; оценка $\mathbb{E}_D[\ell_i]$ через Assumption 2.21 и границы оценки пропагатора; выбор $\lambda=C_{\mathrm{2.21}}(\delta)N^{1/2}$.
Раздел 7 — доказательство Theorem 2.1: стохастический множитель Лагранжа для fuel constraint; рекурсия для $\mathbb{E}_{t_r}[\lambda]$; обратимость матриц $D^{(\ell)}$ (Lemma 7.1). Методы обобщают [2, 3] на constrained non-Markovian control.
Приложение A. Иллюстративные примеры
Example A.1 (Spurious correlation). Недооценка impact: $G^\star - \hat G \succ \Delta I_M$. Тогда
\[ \mathrm{SpurCor} = J(\hat u; G^\star) - J(\hat u; \hat G) = \mathbb{E}[\langle(G^\star-\hat G)\hat u, \hat u\rangle] \geq \Delta\,\mathbb{E}[\|\hat u\|^2]. \]Временный impact: $\hat G=\hat\kappa I_M$, $G^\star=\kappa I_M$, $0<\hat\kappa<\kappa$. Наблюдаемая цена $P_t=\mu t + \sigma W_t$. Оптимальная непрерывная стратегия [12]: $u_t^\star = x_0/T + \mu(T-2t)/(4\kappa)$. При $\kappa\approx 10^{-10}$, $\mu T\approx 0.02$ (bull market) жадная стратегия на $\hat\kappa$ торгует быстрее → усиление издержек порядка $(\kappa/\hat\kappa)^2$. Пессимистичная стратегия $u^{(1)}$ с $\Gamma(u)=\Delta\int_0^T u_t^2\,dt$ совпадает с $u^\star$ при $\hat\kappa+\Delta=\kappa$.
Example A.2 (Эффект штрафа $\ell_1$). $M=2$, $N$ buy metaorders, $u_1^{(i)}\gg u_2^{(i)}\geq 0$ (типичная структура без сигнала [12]). При $\lambda=1$, $V_{N,1}=\sum_i u^{(i)}(u^{(i)})^\top + I_M$ имеет вид $\begin{pmatrix}a_1&a_2\\ a_2&a_3\end{pmatrix}$ с $0 Стратегии $u^{(n)}_{t_i}$ i.i.d. $\mathcal{N}(50,9^2)$; $G^\star_{i,j}=\kappa/(t_i-t_j+1)^\beta$, $\kappa=0.01$, $\beta=0.4$; $\lambda=10^{-3}$, $N=252$, $M=78$. Оценщик (2.16) восстанавливает пропагатор (Figure 4) — при достаточно случайных скоростях торговли Volterra-оценка работает. [1] Y. Abbasi-Yadkori, D. Pál, C. Szepesvári. Improved algorithms for linear stochastic bandits. NeurIPS, 24, 2011. [2] E. Abi Jaber, E. Neuman. Optimal liquidation with signals: the general propagator case. arXiv:2211.00447, 2022. [3] E. Abi Jaber, E. Neuman, M. Voss. Equilibrium in functional stochastic games with mean-field interaction. arXiv:2306.05433, 2023. [4] A. Alfonsi, A. Schied. Capacitary measures for completely monotone kernels via singular control. SIAM J. Control Optim., 51(2):1758–1780, 2013. [5] A. Alfonsi, A. Schied, A. Slynko. Order book resilience, price manipulation, and the positive portfolio problem. SIAM J. Financial Math., 3(1):511–533, 2012. [6] R. Almgren, N. Chriss. Value under liquidation. Risk, 12:61–63, 1999. [7] R. Almgren, N. Chriss. Optimal execution of portfolio transactions. J. Risk, 3(2):5–39, 2000. [8] J. F. Bonnans, A. Shapiro. Perturbation Analysis of Optimization Problems. Springer, 2013. [9] J.-P. Bouchaud, Y. Gefen, M. Potters, M. Wyart. Fluctuations and response in financial markets. Quant. Finance, 4(2):176–190, 2004. [10] J.-P. Bouchaud, J. Bonart, J. Donier, M. Gould. Trades, Quotes and Prices. Cambridge Univ. Press, 2018. [11] D. Brigo, F. Graceffa, E. Neuman. Price impact on term structure. Quant. Finance, 22(1):171–195, 2022. [12] Á. Cartea, S. Jaimungal, J. Penalva. Algorithmic and High-Frequency Trading. Cambridge Univ. Press, 2015. [13] J. Chang, M. Uehara, D. Sreenivas, R. Kidambi, W. Sun. Mitigating covariate shift in imitation learning via offline data with partial coverage. NeurIPS, 34:965–979, 2021. [14] P. Collin-Dufresne, K. Daniel, M. Saglam. Liquidity regimes and optimal dynamic asset allocation. J. Financial Economics, 136(2):379–406, 2020. [15] R. Cont, E. Neuman, A. Micheli. Fast and slow optimal trading with exogenous information. arXiv:2210.01901, 2023. [16] G. Davies. The great bull market reaches its 10th birthday. FT, 2019. [17] S. Diamond, S. Boyd. CVXPY. JMLR, 17(83):1–5, 2016. [18] M. Forde, L. Sánchez-Betancourt, B. Smith. Optimal trade execution for Gaussian signals with power-law resilience. Quant. Finance, 22(3):585–596, 2022. [19] A. Fruth, T. Schöneborn, M. Urusov. Optimal trade execution and price manipulation in order books with time-varying liquidity. Math. Finance, 24:651–695, 2014. [20] J. Gatheral. No-dynamic-arbitrage and market impact. Quant. Finance, 10(7):749–759, 2010. [21] J. Gatheral, A. Schied, A. Slynko. Exponential resilience and decay of market impact. In Econophysics of Order-driven Markets, 2011. [22] J. Gatheral, A. Schied, A. Slynko. Transient linear price impact and Fredholm integral equations. Math. Finance, 22(3):445–474, 2012. [23] I. Gohberg, S. Goldberg, M. A. Kaashoek. Classes of Linear Operators, Vol. I. Birkhäuser, 1990. [24] N. Jegadeesh. Evidence of predictable behavior of security returns. J. Finance, 45(3):881–898, 1990. [25] Y. Jin, Z. Yang, Z. Wang. Is pessimism provably efficient for offline RL? ICML, 5084–5096. PMLR, 2021. [26] R. Kidambi, A. Rajeswaran, P. Netrapalli, T. Joachims. MOReL: Model-based offline reinforcement learning. NeurIPS, 33:21810–21823, 2020. [27] C. A. Lehalle, E. Neuman. Incorporating signals into optimal trading. Finance and Stochastics, 23(2):275–311, 2019. [28] J. Li, C. Tang, M. Tomizuka, W. Zhan. Dealing with the unknown: Pessimistic offline reinforcement learning. arXiv:2111.05440, 2021. [29] A. Madhavan. The Russell reconstitution effect. Financial Analysts J., 59(4):51–64, 2003. [30] A. Micheli, E. Neuman. Evidence of crowding on Russell 3000 reconstitution events. Market Microstructure and Liquidity, 2022. [31] A. Micheli, J. Muhle-Karbe, E. Neuman. Closed-loop Nash competition for liquidity. Math. Finance, 2023. [32] E. Neuman, M. Voss. Optimal signal-adaptive trading with temporary and transient price impact. SIAM J. Financial Math., 13(2):551–575, 2022. [33] E. Neuman, M. Voss. Trading with the crowd. Math. Finance, 33(3):548–617, 2023. [34] E. Neuman, Y. Zhang. Statistical learning with sublinear regret of propagator models. arXiv:2301.05157, 2023. [35] A. A. Obizhaeva, J. Wang. Optimal trading strategy and supply/demand dynamics. J. Financial Markets, 16(1):1–32, 2013. [36] N. Randewich. Wall Street's oldest-ever bull market turns 10 years old. Reuters, 2019. [37] W. S. J. Staff. Inside a Decade-long Bull Run. Wall Street Journal, 2019. [38] B. Tóth, Z. Eisler, J. P. Bouchaud. The short-term price impact of trades is universal. Market Microstructure and Liquidity, 03(02):1850002, 2017. [39] M. Uehara, W. Sun. Pessimistic model-based offline reinforcement learning under partial coverage. arXiv:2107.06226, 2021. [40] M. Vodret, I. Mastromatteo, B. Tóth, M. Benzaquen. Do fundamentals shape the price response? A critical assessment of linear impact models. Quant. Finance, 22(12):2139–2150, 2022.Приложение B. Оценка Volterra-ядер на шумном датасете
Литература