Глубокое обучение с подкреплением для оптимального распределения портфеля: сравнительное исследование с mean-variance оптимизацией

6.5/10

Srijan Sood, Kassiani Papasotiriou, Marius Vaiciulis, Tucker Balch

J.P. Morgan AI Research · J.P. Morgan Global Equities; Oxford-Man Institute of Quantitative Finance · 19 февраля 2026

Оригинал: Sood, S., Papasotiriou, K., Vaiciulis, M. and Balch, T. «Deep Reinforcement Learning for Optimal Portfolio Allocation: A Comparative Study with Mean-Variance Optimization», v1 — arxiv.org/abs/2602.17098 (PDF).

Опубликовано на FinPlan'23 Workshop, 33rd International Conference on Automated Planning and Scheduling (ICAPS). Рис. 1–4 воспроизведены из оригинальной публикации.

Ключевые слова: portfolio optimization, deep reinforcement learning, mean-variance optimization, Sharpe ratio, backtesting.

Классификация arXiv: q-fin.PM

Аннотация

Управление портфелем — процесс надзора за группой инвестиций с целью достижения заранее определённых инвестиционных целей. Оптимизация портфеля — ключевой компонент: распределение активов так, чтобы максимизировать доходность при минимизации принимаемого риска. Обычно этим занимаются финансовые профессионалы, сочетая количественные методы и инвестиционную экспертизу.

Недавние применения глубокого обучения с подкреплением (DRL) показали обнадёживающие результаты при оптимизации распределения портфеля: model-free агенты обучаются на исторических рыночных данных. Многие из этих методов сравнивают себя с простыми бенчмарками или другими state-of-the-art DRL-агентами, но редко — с традиционными методами, которые финансовые профессионалы используют на практике. Одним из наиболее распространённых таких методов является mean-variance оптимизация портфеля (MVO), где по историческим временным рядам оцениваются ожидаемые доходности и ковариации активов, после чего оптимизируется инвестиционная цель.

Наша работа — всестороннее сравнение model-free DRL и MVO для оптимального распределения портфеля. Мы подробно описываем, как заставить DRL для оптимизации портфеля работать на практике, и какие поправки нужны для MVO. Результаты бэктестов демонстрируют сильную производительность DRL-агента по многим метрикам, включая коэффициент Шарпа, максимальные просадки и абсолютную доходность.

1. Введение

Управление портфелем — ключевая задача в финансовых услугах. Она включает распределение средств между различными активами, обычно с целью получения некоррелированных доходностей при минимизации риска и операционных издержек. Портфели могут охватывать разные классы активов (наличные, облигации, акции и т.д.) или оптимизироваться внутри одного класса (например, подбор состава акций для equity-портфеля). Инвесторы могут оптимизировать различные критерии эффективности, часто с фокусом на максимизацию доходности портфеля относительно принятого риска. С появления современной портфельной теории (Markowitz 1952) достигнут значительный прогресс как в теоретических, так и в прикладных аспектах оптимизации портфеля — от улучшений процесса оптимизации до формулировки дополнительных ограничений для рациональных инвесторов (Cornuejols and Tütüncü 2006; Li and Hoi 2014; Kalayci et al. 2017; Ghahtarani, Saif, and Ghasemi 2022). Недавно сообщество активно использует достижения машинного обучения для отбора признаков, прогнозирования и оценки средних и ковариаций активов, а также градиентные методы оптимизации.

За последнее десятилетие RL добился успеха в играх, робототехнике, обработке естественного языка и др. (Silver et al. 2017; Nguyen and La 2019; Su et al. 2016). Последовательный характер принятия решений в Deep RL, вместе с успехами в прикладных задачах, привлёк внимание финансового сообщества. Наиболее популярные направления применения DRL в финансах — автоматизированная торговля акциями (Yang et al. 2020; Théate and Ernst 2021; Zhang, Zohren, and Roberts 2020; Wu et al. 2020), управление риском через deep hedging (Buehler et al. 2019; Du et al. 2020; Cao et al. 2021; Benhamou et al. 2020b) и оптимизация портфеля. В следующем разделе мы рассмотрим ландшафт DRL в задачах оптимизации портфеля и торговли. Хотя эти подходы демонстрируют улучшение относительно предыдущих работ, у них есть недостатки. Например, некоторые генерируют дискретные торговые сигналы по активам, что ограничивает их применимость в более широком управлении портфелем. Кроме того, большинство сравнивает результаты с ML-бенчмарками или buy-and-hold и не учитывает классические методы оптимизации портфеля, такие как mean-variance оптимизация.

В нашей работе мы сравниваем простой и устойчивый DRL-фреймворк, спроектированный вокруг risk-adjusted доходности, с одним из традиционных методов оптимизации портфеля — MVO. Мы обучаем policy-gradient агентов в многоактивной торговой среде, симулирующей рынок акций США (market data replay), и формируем состояния наблюдения из наблюдаемых цен активов. Агенты оптимизируют risk-adjusted доходность — аналогично традиционным MVO-методам. Мы сравниваем производительность DRL-стратегии с MVO через серию систематических бэктестов и наблюдаем улучшение по многим метрикам, включая risk-adjusted доходность, максимальную просадку и оборот портфеля.

2. Обзор литературы

Исследования применения Deep RL к торговле и управлению портфелем активно развиваются. Для оптимизации портфеля большая часть работ фокусируется на различных конфигурациях policy-сетей и сообщает результаты, превосходящие традиционные бейзлайны (Wang et al. 2019; Liang et al. 2018; Lu 2017; Jiang and Liang 2017; Wang et al. 2021; Deng et al. 2016; Cong et al. 2021). Другие работы исследуют фреймворки, вводящие в состояние RL-агента endogenous информацию об активах — технические индикаторы (Liu et al. 2020; Sun et al. 2021; Du and Tanaka-Ishii 2020), а также exogenous информацию из новостных данных (Ye et al. 2020; Lima Paiva et al. 2021).

Типичные бенчмарки для DRL-фреймворков — сравнение с другими DRL- или ML-подходами, buy-and-hold или индексом рынка. Однако такие бенчмарки могут быть слишком упрощёнными или давать лишь относительное сравнение. Чтобы по-настоящему оценить эффективность DRL-агента, meaningful сравнение — с методологиями, которые финансовые профессионалы используют на практике, например mean-variance оптимизацией (MVO).

Есть работы, сравнивающие DRL с MVO (Li et al. 2019; Koratamaddi et al. 2021; i Alonso, Srivastava et al. 2020), но сравнение там служит лишь ещё одним бейзлайном, а методология не описана подробно, поскольку in-depth сравнение не является основным фокусом. Насколько нам известно, только одна работа проводит robust in-depth сравнение MVO и DRL (Benhamou et al. 2020a). Однако во всех этих исследованиях обычно есть расхождение между reward-функцией RL-агента и целевой функцией MVO (например, максимизация дневной доходности vs минимизация риска). Для честного сравнения критично, чтобы оба подхода оптимизировали одну и ту же цель. Кроме того, некоторые подходы дают DRL-агенту exogenous информацию (например, сигналы из новостей), что делает сравнение с MVO предвзятым. Более того, ни одна из этих работ не предоставляет деталей реализации MVO-фреймворков, использованных для сравнения. Мы стремимся устранить эти проблемы, проведя robust сравнение Deep RL и Mean-Variance Optimization для задачи распределения портфеля.

3. Предыстория

Цель оптимизации портфеля — непрерывно диверсифицировать и перераспределять средства между активами с целью максимизации реализованной награды при одновременном ограничении риска. На практике управление портфелем часто направлено не только на максимизацию risk-adjusted доходности, но и на максимально стабильную работу на заданном интервале (например, поквартально или ежегодно).

Markowitz ввёл современную портфельную теорию (MPT) (Markowitz 1952) — фреймворк, позволяющий инвестору математически балансировать толерантность к риску и ожидания доходности для получения эффективно диверсифицированных портфелей. Фреймворк опирается на предположение, что рациональный инвестор предпочтёт портфель с меньшим риском при заданном уровне доходности, и заключает, что риск можно снизить диверсификацией. В этом разделе мы представляем Mean-Variance Optimization (MVO) — одну из главных техник MPT, — с которой позже сравниваем производительность нашего DRL-фреймворка. Также вводим основы RL, описывая технику независимо от оптимизации портфеля.

3.1 Mean-Variance оптимизация портфеля

Mean-Variance Optimization (MVO) — математический процесс распределения капитала между активами портфеля (оптимизация весов) для достижения желаемой инвестиционной цели, обычно: (1) максимизировать доходность при заданном уровне риска, (2) достичь желаемой доходности при минимизации риска, или (3) максимизировать доходность на единицу риска. Риск обычно измеряется волатильностью портфеля (или актива) — дисперсией его доходности. Для заданного набора активов требуются доходности каждого актива и их ковариации. Поскольку истинные доходности неизвестны, на практике они оцениваются или прогнозируются различными методами на основе исторических данных.

Задача формулируется как одно- или многоцелевая оптимизация, решаемая разными способами (Cornuejols and Tütüncü 2006; Kalayci et al. 2017; Ghahtarani, Saif, and Ghasemi 2022). Типичная процедура — решение как выпуклой задачи оптимизации с построением efficient frontier портфелей, таких что ни один портфель нельзя улучшить без ущерба какой-либо метрике (доходность, риск). Пусть $w$ — вектор весов набора активов, $\mu$ — ожидаемые доходности; риск портфеля описывается как $w^\top \Sigma w$ для ковариационной матрицы $\Sigma$. Чтобы достичь желаемой доходности $\mu^*$, решаем:

\[ \min_w \; w^\top \Sigma w \quad \text{s.t.} \quad w^\top \mu \geq \mu^*, \quad w_i \geq 0, \quad \sum_i w_i = 1. \]

Варьируя $\mu^*$, получаем упомянутую efficient frontier. Другая распространённая цель — коэффициент Шарпа (Sharpe 1998; Chen, He, and Zhang 2011), измеряющий доходность на единицу риска. Формально для портфеля $p$:

\[ \text{Sharpe Ratio}_p = \frac{\mathbb{E}[R_p - R_f]}{\sigma_p}, \]

где $R_p$ — доходности портфеля, $\sigma_p$ — стандартное отклонение этих доходностей, $R_f$ — постоянная безрисковая ставка (например, US Treasuries, в недавней истории аппроксимируется 0,0%). Хотя в прямой форме задача максимизации Шарпа

\[ \max_w \; \frac{\mu^\top w - R_f}{(w^\top \Sigma w)^{1/2}} \]

— нетривиальна, её можно переформулировать как выпуклую задачу через замену переменных (Cornuejols and Tütüncü 2006). Мы выбираем коэффициент Шарпа как целевую функцию исследования, поскольку так можно оптимизировать risk-adjusted доходность без явного задания минимальной ожидаемой доходности или максимальной толерантности к риску.

3.2 Обучение с подкреплением

Reinforcement Learning (RL) — подобласть машинного обучения, включающая техники обучения через оптимизацию последовательностей долгосрочных наград при взаимодействии со средой (Sutton and Barto 2018). Среда обычно формализуется как марковский процесс принятия решений (MDP). MDP — 5-кортеж $(S, A, P_a, R_a, \gamma)$, где:

Решение MDP — политика $\pi$, задающая действие $\pi(s)$ в состоянии $s$. Цель — выбрать $\pi$, максимизирующую ожидаемую дисконтированную сумму наград на потенциально бесконечном горизонте:

\[ \mathbb{E}\left[\sum_{t=0}^{\infty} \gamma^t R_{a_t}(s_t, s_{t+1})\right]. \]

Deep Reinforcement Learning (DRL) использует достижения глубокого обучения: нейросети как аппроксиматоры функций для оценки state-action value или обучения отображений политики $\pi$. Эти техники добились огромного успеха в играх, робототехнике, continuous control и финансах (Mnih et al. 2013; Berner et al. 2019; Nguyen and La 2019; Hambly, Xu, and Yang 2021; Charpentier, Elie, and Remlinger 2021).

RL для распределения портфеля. Учитывая успех RL в задачах стохастического управления, RL естественно переносится на оптимизацию портфеля. Неудивительно, что использование DRL для торговли и оптимизации портфеля получило много внимания. Недавние методы фокусируются на обучении deep features и представлений состояния — например, через embedding-признаки из autoencoder и LSTM. Эти embeddings захватывают price-related признаки: от технических индикаторов (Wang et al. 2019; Soleymani and Paquet 2020; Wang et al. 2021) до информации из новостей для учёта колебаний цен (Ye et al. 2020). Другие предложенные признаки используют attention-сети или графовые структуры (Wang et al. 2021, 2019) для cross-asset feature extraction.

4. Постановка задачи

Мы формулируем задачу оптимизации портфеля в RL-постановке. Как описано в разделе 3, RL предполагает взаимодействие агента со средой. Для оптимизации портфеля мы создаём среду, симулирующую рынок акций США (market data replay), и формируем состояния наблюдения из наблюдаемых цен активов. Действия агента выдают набор весов портфеля, используемых для ребалансировки на каждом шаге.

4.1 Действия

Для распределения портфеля по $N$ активам агент выбирает веса $w = [w_1, \ldots, w_N]$ такие, что $\sum_{i=1}^N w_i = 1$, где $0 \leq w_i \leq 1$. Вес 0 означает нулевую позицию по активу, вес 1 — полную концентрацию портфеля в этом активе. В расширениях фреймворка $w_i < 0$ допускало бы шорт, $w_i > 1$ — leveraged позицию. В нашем случае ограничиваем действия non-leveraged long-only позициями. Ограничения обеспечиваются применением softmax к непрерывным действиям агента.

4.2 Состояния

Цена актива в момент $t$ обозначается $P_t$. Однопериодная simple return: $R_t = \frac{P_t - P_{t-1}}{P_{t-1}}$. Следовательно, однопериодная gross return: $\frac{P_t}{P_{t-1}} = R_t + 1$. Однопериодная log return:

\[ r_t = \log\frac{P_t}{P_{t-1}} = \log(R_t + 1). \]

Выбираем дневной период и вычисляем дневные log returns по ценам закрытия. Log returns актива за lookback-период $T$:

\[ r_t = [r_{t-1}, r_{t-2}, \ldots, r_{t-T+1}]. \]

В нашем случае $T = 60$ дней. Для набора из $n + 1$ активов — $n$ ценных бумаг и cash (обозначим $c$) — формируем состояние наблюдения агента в момент $t$, $S_t$, как матрицу $[(n+1) \times T]$:

\[ S_t = \begin{bmatrix} w_1 & r_{1,t-1} & \ldots & r_{1,t-T+1} \\ w_2 & r_{2,t-1} & \ldots & r_{2,t-T+1} \\ \vdots & \vdots & \ddots & \vdots \\ w_n & r_{n,t-1} & \ldots & r_{n,t-T+1} \\ w_c & \mathrm{vol}_{20} & \mathrm{vol}_{60} & \mathrm{VIX}_t & \ldots \end{bmatrix}. \]

Первый столбец — вектор распределения портфеля $w$ агента на входе в шаг $t$. Он может незначительно отличаться от весов, выбранных на предыдущем шаге: непрерывные веса конвертируются в фактическое распределение (только целые акции), после чего веса нормируются к сумме 1.

Для каждого non-cash актива включаем log returns за $T$ — вектор $[r_{n,t-1}, \ldots, r_{n,t-T+1}]$ для актива $n$ в матрице состояния выше. В последней строке — три индикатора рыночной волатильности в момент $t$: $\mathrm{vol}_{20}$, $\mathrm{vol}_{60}$, VIX (подробнее в разделе 5).

4.3 Награда

Вместо максимизации доходности большинство современных портфельных менеджеров стремятся максимизировать risk-adjusted доходность. Для DRL в распределении портфеля нужна reward-функция, оптимизирующая risk-adjusted returns. Наиболее распространённая мера — коэффициент Шарпа, но он неподходит для online learning, поскольку определён на периоде $T$. Для решения используем Differential Sharpe Ratio $D_t$ (Moody et al. 1998), представляющий risk-adjusted доходность на каждом шаге $t$; показано, что это даёт более стабильные доходности, чем максимизация прибыли (Moody and Saffell 2001; Dempster and Leemans 2006). Агент, максимизирующий будущие Differential Sharpe rewards, учится оптимизировать risk-adjusted returns.

Коэффициент Шарпа за период из $t$ доходностей $R_t$ выражается через оценки первого и второго моментов распределения доходностей:

\[ S_t = \frac{A_t}{\sqrt{K_t(B_t - A_t^2)}}, \]

где

\[ A_t = \frac{1}{t}\sum_{i=1}^t R_i, \qquad B_t = \frac{1}{t}\sum_{i=1}^t R_i^2, \qquad K_t = \frac{t}{t-1}, \]

$K_t$ — нормирующий множитель. $A$ и $B$ рекурсивно оцениваются как экспоненциальные скользящие средние доходностей и дисперсии на временной шкале $\eta^{-1}$. Differential Sharpe Ratio $D_t$ получается разложением $S_t$ до первого порядка по $\eta$:

\[ S_t \approx S_{t-1} + \eta D_t\big|_{\eta=0} + O(\eta^2), \]

где

\[ D_t \equiv \frac{\partial S_t}{\partial \eta} = \frac{B_{t-1}\,\Delta A_t - \tfrac{1}{2}A_{t-1}\,\Delta B_t}{(B_{t-1} - A_{t-1}^2)^{3/2}}, \]

с

\[ A_t = A_{t-1} + \eta\,\Delta A_t, \qquad B_t = B_{t-1} + \eta\,\Delta B_t, \] \[ \Delta A_t = R_t - A_{t-1}, \qquad \Delta B_t = R_t^2 - B_{t-1}. \]

Инициализируем $A_0 = B_0 = 0$. Выбираем $\eta \approx 1/252$ (в году ~252 торговых дня).

4.4 Алгоритм обучения

RL-алгоритмы делятся на model-based и model-free в зависимости от того, имеет ли агент доступ к модели среды или должен её обучать. Model-free алгоритмы учат последствия действий через сбор опыта (Policy Gradient, Q-Learning и др.): агент многократно пробует действие и корректирует политику по исходам для оптимизации наград.

Policy optimization. Методы policy optimization центрируются вокруг политики $\pi_\theta(a \mid s)$ — отображения состояния $s$ в распределение следующего действия $a$. Параметры $\theta$ оптимизируются gradient ascent по целевой $J(\pi_\theta)$ или через локальные аппроксимации $J(\pi_\theta)$. Оптимизация почти всегда on-policy: опыт собирается последней политикой и используется для её улучшения. Примеры: A2C/A3C (Mnih et al. 2016) и PPO (Schulman et al. 2017). В экспериментах используем PPO.

4.5 Детали RL-среды

Среда — обёртка над рынком, скользящая по историческим данным (market replay). Она также играет роль брокера и биржи: на каждом шаге обрабатывает действия агентов и ребалансирует портфель по последним ценам и заданному распределению. При смене дня и поступлении новых цен передаёт агенту наблюдения вместе с Differential Sharpe reward. В рамках исследования предполагаем нулевые транзакционные издержки и мгновенную ребалансировку.

В начале каждого шага $t$ среда вычисляет текущую стоимость портфеля:

\[ \mathrm{port\,val}_t = \sum_i P_{i,t} \cdot \mathrm{shares}_{i,t-1} + c_{t-1}, \]

где $P_i$ — цена индекса $i$ в день $t$, $\mathrm{shares}_{i,t-1}$ — число акций индекса на $t-1$, $c_{t-1}$ — наличные на $t-1$.

Для расчёта $\mathrm{shares}_{i,t}$ и $c_t$ среда распределяет $\mathrm{port\,val}_t$ между индексами и cash согласно новым весам $w_i$. Затем ребалансирует веса $w_i$ в $w_i^{\mathrm{reb}}$: умножает $w_i$ на текущую стоимость портфеля, округляет число акций вниз и конвертирует остаток в cash.

После ребалансировки среда формирует следующее состояние $S_{t+1}$ и переходит к шагу $t+1$. Вычисляет новую стоимость портфеля по $P_{t+1}$ и возвращает агенту награду $R_t = D_t$.

5. Эксперименты

5.1 Данные и признаки

Используем дневные adjusted close цены секторных индексов S&P 500 (рис. 1), индекса VIX и индекса S&P 500 за 2006–2021 гг. (включительно) из Yahoo Finance. По ценовым данным вычисляем log returns, как в разделе 4.2.

Рисунок 1. S&P 500 и 11 секторных индексов, 2006–2021
Рисунок 1. S&P 500 и его 11 секторных индексов за 2006–2021 гг.

Для захвата рыночного режима вычисляем три метрики волатильности по индексу S&P 500. Первая, $\mathrm{vol}_{20}$, — 20-дневное rolling standard deviation дневных доходностей S&P 500; вторая, $\mathrm{vol}_{60}$, — 60-дневное; третья — отношение $\mathrm{vol}_{20}/\mathrm{vol}_{60}$. Это отношение показывает тренд краткосрочной vs долгосрочной волатильности. Если $\mathrm{vol}_{20}/\mathrm{vol}_{60} > 1$, дневные доходности S&P 500 за последние 20 дней были более волатильны, чем за последние 60 — возможный переход от низкой к высокой волатильности (и наоборот). В матрицу наблюдения включаем первую и третью метрики, а также значение VIX. Значения стандартизируются вычитанием среднего и делением на стандартное отклонение; среднее и стандартное отклонение оцениваются expanding lookback window для предотвращения information leakage.

5.2 Deep RL подход

Процесс обучения. Финансовые данные notoriously scarce (по крайней мере на дневной шкале), но мы хотим протестировать DRL-фреймворк на многих годах (бэктестах). Кроме того, финансовые временные ряды нестационарны (Cont 2001); это можно смягчить retraining или fine-tuning на самых свежих данных. С учётом этих stylized facts эксперимент устроен так:

Данные разбиты на 10 sliding window групп (сдвиг 1 год). Каждая группа содержит 7 лет данных: первые 5 — обучение, следующий 1 — burn year для validation обучения, последний — out-of-sample бэктест.

На первом раунде обучения инициализируем 5 агентов (разные seeds) с гиперпараметрами из следующего раздела. Все пять начинают обучение на данных [2006–2011) и периодически оцениваются на validation-периоде 2011. В конце первого раунда сохраняем лучшего агента (по наивысшей средней episode validation reward). Финальный год (2012) held-out для бэктеста.

Этот агент используется как seed policy для следующей группы из 5 агентов в окне [2007–2012), validation year 2012 и test year 2013; процесс повторяется до финального validation-периода 2020. Итого: 50 агентов (10 периодов × 5 агентов) и 10 соответствующих бэктестов.

Реализация PPO и гиперпараметры. Используем реализацию PPO из StableBaselines3 (Raffin et al. 2021); гиперпараметры — в табл. 1. Выбраны по эмпирическим исследованиям (Henderson et al. 2018; Engstrom et al. 2019; Rao et al. 2020), а также coarse grid search на held-out validation data.

Таблица 1. Гиперпараметры PPO.
ПараметрЗначение
training timesteps7,5M
n envs10
n steps756
batch size1260
n epochs16
gamma0,9
gae lambda0,9
clip range0,25
learning rate3e-4 с annealing до 1e-5

Используем Vectorized SubProcVecEnv wrappers StableBaselines3 для сбора experience rollouts через multiprocessing по независимым экземплярам среды. Вместо одной среды на шаг обучаем на $n_{\mathrm{envs}} = 10$ средах для более разнообразного опыта и ускорения. Каждый раунд — 7,5M timesteps (~600 episodes на раунд на среду): $(252 \text{ торг. дня/год} \times 5 \text{ лет/раунд}) \times 10 \text{ сред} \times 600 \text{ episodes} \approx 7{,}5\text{M}$ timesteps. Rollout buffer: $n_{\mathrm{steps}} = 252 \times 3 \times n_{\mathrm{envs}}$. Learning rate — decaying function от оставшегося прогресса: от $3 \times 10^{-4}$ до $1 \times 10^{-5}$. Batch size 1260 $= 252 \times 5$; $n_{\mathrm{epochs}} = 16$; $\gamma = 0{,}9$; GAE $\lambda = 0{,}9$; clip range $= 0{,}25$. Архитектура — fully-connected [64, 64] с tanh activations; политика инициализируется с $\log\,\mathrm{std}_{\mathrm{init}} = -1$.

5.3 Mean-Variance подход

Для сравнения model-free DRL с MVO выравниваем условия обучения и эксплуатации. MVO использует 60-дневный lookback (как DRL) для оценки средних и ковариаций. Средние активов — sample means за lookback. Sample covariance напрямую не используем: она подвержена estimation error, несовместимой с MVO. Применяем Ledoit-Wolf Shrinkage operator (Ledoit and Wolf 2004). Дополнительно enforce non-singular и positive-semi-definite условия на ковариационные матрицы: отрицательные собственные значения обнуляем и пересобираем матрицы.

По оценённым средним и ковариациям за lookback оптимизируем задачу Sharpe Maximization и получаем веса на каждом шаге. Используем PyPortfolioOpt (Martin 2021).

5.4 Оценка и бэктестинг

Оцениваем обе техники через 10 независимых бэктестов [2012–2021]. Обе стратегии начинают каждый период с полностью cash-портфеля в 100 000 USD. Затем торгуют ежедневно по весам каждого метода с ограничениями $\sum_i w_i = 1$, $0 \leq w_i \leq 1$ и покупкой только целого числа акций. Получаем дневные стоимости (и доходности) портфеля для статистик раздела 6 (Pyfolio).

DRL-агент: оцениваем обученных PPO-агентов в deterministic mode. Для каждого бэктеста между последним днём обучения и периодом бэктеста — burn year. Например, бэктест 2012 использует агента, обученного на [2006–2011), 2011 — burn year.

MVO: обучение не требуется; перед каждым днём используется 60-дневный lookback. Бэктест с января 2012 использует данные с октября 2011 (окно сдвигается каждый день).

6. Результаты

Рисунок 2 иллюстрирует метрики производительности по описанному процессу бэктеста на всех test-периодах [2012–2021]. DRL-агент превосходит MVO-портфель: более высокий Sharpe и более низкие годовые maximum drawdowns практически каждый год; также marginally ниже максимальная просадка.

Рисунок 2. Результаты бэктеста: MVO vs DRL
Рисунок 2. Результаты бэктеста: распределение портфеля MVO vs DRL.

Для сравнения общей производительности за весь период бэктеста усредняем по всем 10 периодам. Для DRL усредняем по 5 агентам (разные seeds) для каждого года, затем по всем периодам. Для MVO — по всем 10 годам. Табл. 2: годовая доходность и Sharpe DRL примерно в 1,85 раза выше, чем у MVO. DRL достигает Sharpe 1,17 за полный период бэктеста против 0,68 у MVO.

Таблица 2. Статистики DRL и MVO. Все метрики усреднены по 10 бэктестам [2012–2021], кроме Max Drawdown — максимум за любой период.
МетрикаDRLMVO
Annual return0,12110,0653
Cumulative returns0,11950,0650
Annual volatility0,12490,1460
Sharpe ratio1,16620,6776
Calmar ratio2,31331,1608
Stability0,62340,4841
Max drawdown−0,3296−0,3303
Omega ratio1,23601,1315
Sortino ratio1,72081,0060
Skew−0,4063−0,3328
Kurtosis2,70542,6801
Tail ratio1,04230,9448
Daily value at risk−0,0152−0,0181

Рис. 3a) и 4a) — помесячные доходности за все бэктесты для двух методов. DRL демонстрирует более стабильные месячные доходности, чем MVO, который чаще колеблется между периодами высокой и низкой доходности без устойчивой положительной траектории. На рис. 3b) и 4b) — годовые доходности; пунктирная линия — средняя годовая доходность по 10 бэктестам. У DRL положительные доходности почти во все годы — заметно стабильнее, чем у MVO. Рис. 3c) и 4c) — распределение помесячных доходностей, усреднённое по месяцам. У DRL меньше стандартное отклонение и разброс, положительное среднее.

Рисунок 3. DRL: a) помесячные доходности b) годовые доходности c) распределение помесячных доходностей
Рисунок 3. a) Помесячные доходности DRL b) Годовые доходности DRL c) Распределение помесячных доходностей DRL.
Рисунок 4. MVO: a) помесячные доходности b) годовые доходности c) распределение помесячных доходностей
Рисунок 4. a) Помесячные доходности MVO b) Годовые доходности MVO c) Распределение помесячных доходностей MVO.

Далее вычисляем дневное изменение портфеля каждой стратегии — изменение весов. $\Delta p_w$ — абсолютная поэлементная разность двух распределений (cash-компонент игнорируется). Покупка и продажа считаются отдельными транзакциями, $\Delta p_w \in [0{,}0,\, 2{,}0]$. Например, если в $t-1$ портфель сосредоточен в non-cash активе A, а в $t$ — полностью в B, нужно продать все A и купить эквивалент B → $\Delta p_w = 2{,}0$.

По метрике $\Delta p_w$ RL-стратегия реже меняет состав портфеля. На практике это означает более низкие средние транзакционные издержки. Среднее изменение состава у mean-variance портфеля почти вдвое выше, чем у DRL, в спад рынка марта 2020 (рис. 2), когда торговые условия были особенно сложными (значительно ниже ликвидность и повышенные bid/ask spreads). Наконец, производительность DRL — среднее по пяти агентам с разными seeds, что даёт дополнительную регуляризацию и, вероятно, более стабильную out-of-sample стратегию по сравнению с MVO.

7. Заключение

Ключевые вклады:

7.1 Будущая работа

Планируем моделировать transaction costs и slippage — явным расчётом при реаллокации активов или штрафом в reward. Также — компонент минимизации drawdown в reward для более стабильной торговой стратегии.

Другая область — обучение regime switching модели, балансирующей средства между двумя агентами в зависимости от рыночной волатильности (низкая vs высокая): один обучен на low-volatility, другой — на high-volatility режиме. Сравним текущую implicit regime parametrization с explicit.

Благодарности

Документ подготовлен в информационных целях группой Artificial Intelligence Research J.P. Morgan Chase & Co. и аффилированных лиц («J.P. Morgan») и не является продуктом Research Department J.P. Morgan. J.P. Morgan не даёт никаких заверений и отказывается от ответственности за полноту, точность или надёжность содержащейся информации. Документ не предназначен как investment research или investment advice, рекомендация, предложение или solicitation покупки или продажи ценных бумаг, финансовых инструментов, продуктов или услуг и не может использоваться для оценки участия в любой сделке; не является solicitation в любой юрисдикции или любому лицу, если такая solicitation была бы незаконной.

Литература

Оригинал статьи: Sood et al., «Deep Reinforcement Learning for Optimal Portfolio Allocation: A Comparative Study with Mean-Variance Optimization», arXiv:2602.17098