Deep RL для диверсифицированного управления портфелем на глобальных рынках акций

7/10

Kamil Kashif (ORCID: 0009-0004-0666-581X), Robert Ślepaczuk (ORCID: 0000-0001-5227-2014, corresponding author: rslepaczuk@wne.uw.edu.pl)

Quantitative Finance Research Group, Faculty of Economic Sciences, University of Warsaw, ul. Długa 44–50, 00-241 Warsaw, Poland

Оригинал: Kashif, K. & Ślepaczuk, R. «Deep Reinforcement Learning Framework for Diversified Portfolio Management Across Global Equity Markets», 17 мая 2026 — arxiv.org/abs/2605.17307 (PDF, 67 стр.).

Рис. 1–11 — из оригинала (67-страничный PDF). Ниже — полный русскоязычный пересказ основных разделов, ключевых уравнений и главных таблиц; формального приложения с доказательствами в работе нет.

Ключевые слова: Reinforcement Learning, Deep RL, Hierarchical RL, Soft Actor-Critic, распределение портфеля, алгоритмический трейдинг, market timing, Walk-Forward Optimization, rolling retraining, Nasdaq-100, Nikkei 225, Euro Stoxx 50, иерархическая политика, Dirichlet, MDP.

JEL: C4, C14, C45, C53, C58, G13.

Аннотация

В работе разрабатывается и оценивается фреймворк deep reinforcement learning для динамического распределения портфеля на глобальных рынках акций. Алгоритм Soft Actor–Critic (SAC) обучает непрерывные веса портфеля в рамках марковского процесса принятия решений (MDP), учитывая транзакционные издержки, штрафы за оборот и ограничения диверсификации непосредственно в функции вознаграждения.

Сравниваются пять конфигураций модели — LSTM_1, LSTM_2, LSTM_NC_1, LSTM_NC_2 и TRANSFORMERS — которые различаются формулировкой reward (абсолютная vs относительно бенчмарка), структурой политики (плоская vs иерархическая Dirichlet), портфельными ограничениями (полная инвестиция vs гибкая доля cash) и временным энкодером (LSTM vs Transformer). Оценка проводится методом walk-forward optimization на шестнадцати out-of-sample фолдах за период 2003–2026 по индексам Nasdaq-100, Nikkei 225 и Euro Stoxx 50.

Результаты показывают, что RL-стратегии достигают конкурентоспособной risk-adjusted доходности прежде всего на Euro Stoxx 50, где по регрессионному анализу наблюдаются статистически значимые аномальные доходности; центральная гипотеза подтверждается лишь частично: ни одна стратегия не демонстрирует HAC-устойчивого статистически значимого превышения доходности относительно Buy & Hold на всех рынках одновременно. Анализ режимов показывает, что RL добавляет наибольшую ценность в периоды повышенной неопределённости; агрегация ансамбля по рынкам улучшает risk-adjusted результат — конфигурация LSTM_1 достигает IR2 = 0,41 против 0,34 у общего бенчмарка.

1. Введение

Прогнозирование и навигация на финансовых рынках остаётся сложной задачей из-за их неизбежной волатильности, сложной структуры и постоянно меняющейся экономической среды. За последние десятилетия крупные события — глобальный финансовый кризис 2008 года и пандемия COVID-19 — показали, насколько быстро могут меняться рыночные условия, что затрудняет обобщение традиционных моделей на разные режимы. В ответ исследователи и практики исследуют широкий спектр подходов: от классических статистических моделей до продвинутых методов машинного обучения.

В последние годы reinforcement learning (RL) зарекомендовал себя как перспективный фреймворк для финансового принятия решений. В отличие от supervised learning, ориентированного на прогноз цен или доходностей, RL напрямую моделирует задачу распределения портфеля как последовательное принятие решений: агент взаимодействует со средой и оптимизирует долгосрочную цель, а не точечный прогноз.

Главная цель исследования — разработать и оценить RL-стратегии распределения портфеля при реалистичных рыночных условиях. Задача формулируется как MDP; для обучения динамических политик распределения используется алгоритм Soft Actor–Critic (SAC). Фреймворк включает транзакционные издержки, штрафы за оборот и ограничения диверсификации в целевой функции обучения, а также схему walk-forward optimization (WFO) с адаптивным переобучением, имитирующую реалистичное развёртывание стратегии.

Центральный аспект работы — систематическое сравнение проектных решений внутри RL-фреймворка: формулировка reward (абсолютная vs относительно бенчмарка), структура политики (плоская vs иерархическое распределение), портфельные ограничения (полная инвестиция vs гибкая экспозиция) и временное кодирование (LSTM vs Transformer).

Центральная гипотеза: RL-стратегии распределения портфеля способны достигать устойчивой и экономически значимой доходности при обучении с реалистичными ограничениями и процедурами оценки; их эффективность сильно зависит от архитектурных и экономических решений. Дополнительно предполагается, что относительная эффективность RL варьирует по макроэкономическим режимам: активное распределение добавляет большую ценность в периоды повышенной неопределённости и более низкой персистентности тренда.

Исследование отвечает на шесть исследовательских вопросов:

Для оценки используется кросс-секционная вселенная из трёх крупных индексов: Nasdaq-100 (США), Nikkei 225 (Азия) и Euro Stoxx 50 (Европа). Полная выборка — с 2 января 2003 по 13 марта 2026, дневная частота, охватывает множество режимов, включая периоды высокой волатильности и структурных сдвигов.

Эмпирическая процедура — WFO: каждая итерация включает 5 лет обучения, 1 год validation и 1 год test (16 фолдов). Это позволяет модели адаптироваться к меняющимся условиям при строгой out-of-sample оценке.

Вклад работы: (1) единый мультирыночный WFO-фреймворк с идентичными процедурами на трёх экономически различных рынках; (2) иерархическая Dirichlet-политика, разделяющая решение «акции vs cash» и выбор отдельных активов; (3) критерий adaptive retraining по rolling validation Sharpe; (4) систематическая декомпозиция по трём макроэкономическим подпериодам.

Структура работы: раздел 2 — обзор литературы (2.1–2.5); раздел 3 — data engineering (3.1–3.3); раздел 4 — theoretical background MDP/RL/DRL (4.1–4.5); раздел 5 — methodology SAC/WFO (5.1–5.10); раздел 6 — empirical results и statistical inference (6.1–6.5); раздел 7 — regime analysis; раздел 8 — ensemble total fund; раздел 9 — discussion RQ1–RQ6; раздел 10 — conclusions и future work. Основной текст оригинала — 67 страниц PDF без formal proofs appendix.

2. Обзор литературы

Исторически алгоритмический трейдинг опирался на rule-based исполнение, эконометрическое моделирование и supervised ML для снижения человеческих biases при входе и выходе с рынка. Сейчас происходит смена парадигмы: исследователи выходят за рамки статического прогнозирования цен и всё активнее изучают RL — особенно в сочетании с deep architectures — как комплексный подход к последовательному принятию решений, распределению портфеля и оптимизации риска.

2.1. Оптимизация портфеля

Фундамент современной оптимизации портфеля заложил Markowitz (1952): mean-variance optimization (MVO) балансирует ожидаемую доходность и риск через ковариационные матрицы, строя efficient frontier. Математически элегантный, MVO на практике нестабилен: Black & Litterman (1992) показали, что он часто даёт чрезмерно концентрированные портфели, гиперчувствительные к ошибкам оценки параметров.

Современная литература интегрирует прогнозные модели в цикл оптимизации. Ślusarczyk & Ślepaczuk (2025) модернизируют MVO, прогнозируя доходности гибридами time series и ML (ARIMA-GARCH, XGBoost). Chaweewanchon & Chaysiri (2022) объединяют CNN-BiLSTM-прогноз с классической MV-моделью на SET50. López de Prado et al. (2025) исследуют включение ML в Markowitz-фреймворк для alpha, risk management и CVaR.

Важный бенчмарк — equal-weight (1/N) стратегия DeMiguel et al. (2009): наивная диверсификация без оценки параметров устойчиво конкурирует или превосходит сложные mean-variance портфели out-of-sample. Это устанавливает equal-weight как строгий бенчмарк для любой активной стратегии распределения.

2.2. Машинное и deep learning в финансах

Применение statistical learning к рынкам означает сдвиг от проверки экономических гипотез к максимизации прогнозной точности. Финансовые ряды нелинейны; исследователи используют supervised frameworks. SVM (Kim, 2003) и Random Forest (Khaidem et al., 2016) показали устойчивость к выбросам. Grudniewicz & Ślepaczuk (2023) на глобальных рынках отмечают преимущество Linear SVM над Bayesian GLM.

Однако шум в финансовых сигналах и риск backtest overfitting остаются критичными. Bailey et al. (2017) предложили model-free framework для количественной оценки вероятности overfitting; López de Prado (2018) указывает на частые провалы ML-фондов и предлагает walk-forward backtesting и deflated Sharpe ratio.

Для временных рядов эволюция шла от RNN (Lin et al., 2021) к LSTM (Fischer & Krauss, 2018; Krynska & Ślepaczuk, 2023; Kashif & Ślepaczuk, 2025) и далее к Transformer (Kabir et al., 2025; Stefaniuk & Ślepaczuk, 2025). Bieganowski & Ślepaczuk (2025) показывают, что supervised autoencoders с recurrent структурами эффективны при robust labeling (Triple Barrier Method). Точность прогноза не гарантирует качество торгового правила — RL оптимизирует непосредственно целевую функцию портфеля.

2.3. Reinforcement и deep reinforcement learning в финансах

RL в финансах — переход от статического прогнозирования к активному agentic decision-making. Hambly et al. (2023) систематизируют современный financial RL, контрастируя его с классическим stochastic control: model-free RL справляется с высокоразмерными задачами без полной спецификации динамики рынка и естественно объединяет прогноз и решение (optimal execution, portfolio optimization, smart order routing).

Moody & Saffell (2001) ввели Direct Reinforcement (DR) и Recurrent RL (RRL): оптимизация risk-adjusted returns через differential Sharpe ratio без explicit forecasting models, avoiding Bellman curse of dimensionality; empirical results на S&P 500 и T-Bills favor RRL over value-function methods.

FinRL-Meta (Liu et al., 2021) стандартизирует среды near-real-market для DRL, но часто упрощает издержки и не проводит строгий мультирыночный WFO. Jiang et al. (2024) используют TD3 с extended mean–variance reward. Soleymani & Paquet (2020) — DeepBreath с restricted stacked autoencoder; Yang et al. (2020) — ensemble PPO/A2C/DDPG на 30 Dow Jones stocks; Wu et al. (2020) — GRU-based GDQN/GDPG на US/UK/China markets.

Enkhsaikhan & Jo (2025) формулируют portfolio optimization как CMDP с augmented Lagrangian; Tamuly et al. (2024) — DQN с experience replay; Cheng & Sun (2024) и Shavandi & Khedmati (2022) — multi-agent DRL; Millea (2023) — hierarchical model-based RL на crypto; Hao et al. (2023) — fuzzy ensemble DRL. Bracha et al. (2025), Du et al. (2020), Kabbani & Duman (2022), Rani et al. (2025), Zhang et al. (2026) расширяют DRL на hedging, options, HFT и cluster embedding.

Sterling & Thorne (2026) рассматривают системный уровень развёртывания DRL (governance, systemic risk, infrastructure). Настоящее исследование отличается иерархической Dirichlet-политикой, adaptive retraining и единой WFO-процедурой на Nasdaq-100, Nikkei 225 и Euro Stoxx 50 одновременно.

2.4. Reinforcement learning за пределами финансов

Методы RL в работе восходят к DQN (Mnih et al., 2015), PPO (Schulman et al., 2017) и SAC (Haarnoja et al., 2018). SAC расширяет actor–critic maximum-entropy RL для exploration и стабильности в continuous action spaces. Эти advances релевантны для portfolio allocation: высокоразмерные нестационарные среды, long-term risk-adjusted objectives, реалистичные ограничения — отсюда WFO и штрафы за оборот в финансовом контексте.

2.5. Сводка обзора литературы

Литература демонстрирует прогрессию от статической mean-variance оптимизации к адаптивным data-driven системам. MVO дало математический фундамент, но чувствительно к ошибкам оценки в нестационарной среде. ML улучшил захват нелинейностей, однако low signal-to-noise, overfitting и зависимость от прогноза доходностей ограничивают robustness.

RL переформулирует финансовое decision-making как sequential optimization: агент учится политике, максимизирующей long-term risk-adjusted performance при transaction costs и frictions. Deep RL работает в high-dimensional state spaces, но performance чувствителен к reward specification, stability и non-stationarity — требуются careful design и WFO-оценка.

Вывод: supervised подходы полезны как foundation, но недостаточны для dynamic sequential nature финансовых решений. Это мотивирует DRL как unified framework, интегрирующий prediction, execution и risk management в одной adaptive system.

Связь с настоящим исследованием: prior DRL portfolio work (Deng et al., 2017; Soleymani & Paquet, 2020; Wu et al., 2020; Jiang et al., 2024; Yang et al., 2020) преимущественно single-market и rarely combines hierarchical policies, adaptive retraining, и identical WFO across three global indices — пробел, который заполняет данная работа на 67 страницах arXiv:2605.17307.

3. Данные

Исследование охватывает три крупных equity-индекса — Nasdaq-100, Nikkei 225 и Euro Stoxx 50 — представляющих рынки США, Азии и Европы и обеспечивающих географическую диверсификацию для кросс-рыночного анализа.

3.1. Описание данных

Эмпирический анализ основан на мультиисточниковом датасете для обучения и оценки RL-фреймворка динамического распределения портфеля. Датасет интегрирует ценовую информацию на уровне активов, динамику состава индексов и бенчмарк-серии.

Дневные цены всех конституентов получены через API yfinance (стандартные рыночные переменные). Историческая информация о составе индексов (добавления и исключения) — из Bloomberg Terminal Anywhere; используется для реконструкции time-varying membership и устранения survivorship bias.

Tradable бенчмарки: Invesco QQQ Trust (QQQ) для Nasdaq-100; SPDR Euro Stoxx 50 ETF (FEZ) для Euro Stoxx 50; iShares MSCI Japan ETF (EWJ) как прокси Nikkei 225. Полная выборка: 2 января 2003 — 13 марта 2026. После сбора все источники выровнены в едином preprocessing pipeline.

На рис. 1 — нормализованные ценовые траектории активов (каждый ряд масштабирован к 1 в первой доступной точке; красная линия — benchmark ETF). Три панели: Nasdaq-100, Nikkei 225, Euro Stoxx 50 — визуально демонстрируют различную long-term drift и volatility structure, мотивируя multi-market evaluation.

Описательная статистика индексов (табл. 1–2 PDF): Nasdaq-100 — count 5836 obs, mean price 154 (std 154), range [20, 635]; Nikkei 225 — 5676 obs, mean 51 (12); Euro Stoxx 50 — 5836 obs, mean 30 (11). Daily log-returns: mean около 0,0001–0,0005; std 0,013–0,016; skewness −0,12 to −0,33; excess kurtosis 7,1–9,9; min/max daily moves до ±14%; Jarque–Bera rejects normality at 1% для всех трёх рядов.

Рисунок 1
Рисунок 1. Нормализованные ценовые траектории активов в двух инвестиционных вселенных.

3.2. Подготовка данных

3.2.1. Состав индекса и survivorship bias

Survivorship bias возникает, когда учитываются только текущие конституенты, игнорируя исключённые активы — это завышает оценки доходности. Для устранения bias использована полная история membership из Bloomberg с реконструкцией true time-varying composition каждого индекса. Рис. 2 показывает эволюцию числа конституентов во времени (динамическая investable universe).

3.2.2. Построение tradable universe

Цены объединены с historical membership matrix, расширенной до daily frequency. Строится tradability mask: актив доступен, если он одновременно член индекса и имеет valid price observation. Это устраняет survivorship bias и look-ahead errors.

Bloomberg membership forward-fill между событиями добавления/удаления; yfinance prices выровнены на common daily index; пропуски — forward-fill последней цены закрытия. Активы без valid price исключаются независимо от membership. Эффективные диапазоны для всех трёх индексов: 2003-01-02 — 2026-03-13 (с minor различиями в числе торговых дней из-за национальных календарей).

Рисунок 2
Рисунок 2. Эволюция числа конституентов индексов во времени.

3.3. Итог по данным

Рис. 3 суммирует pipeline: Bloomberg (historical membership) + yfinance (daily prices) → tradable mask → model-ready dataset. Обработанные данные служат входом RL-фреймворку (раздел 5).

Рисунок 3
Рисунок 3. Конвейер построения данных для RL-фреймворка.

4. Теоретические основы

Финансовое decision-making — последовательные решения под неопределённостью: действия в момент $t$ влияют на будущие исходы. В portfolio allocation инвестор наблюдает рынок, выбирает веса, получает доходности. Эта sequential structure естественно ложится на RL.

4.1. Марковские процессы принятия решений (MDP)

Portfolio allocation формулируется как sequential decision problem. MDP $(\mathcal{S}, \mathcal{A}, P, r, \gamma)$: $\mathcal{S}$ — состояния; $\mathcal{A}$ — действия (распределения); $P(s_{t+1} \mid s_t, a_t)$ — переходы; $r(s_t, a_t)$ — награда; $\gamma \in (0, 1)$ — discount factor.

Markov property:

\[ P(s_{t+1} \mid s_t, a_t, s_{t-1}, a_{t-1}, \ldots) = P(s_{t+1} \mid s_t, a_t). \]

В finance это аппроксимация; state включает recent observations через lookback window.

4.2. Reinforcement learning

Policy $\pi(a \mid s)$ максимизирует expected cumulative reward. Return:

\[ G_t = \sum_{k=0}^{\infty} \gamma^k r_{t+k+1}. \]

Value functions:

\[ V^{\pi}(s) = \mathbb{E}_{\pi}[G_t \mid s_t = s], \qquad Q^{\pi}(s,a) = \mathbb{E}_{\pi}[G_t \mid s_t = s, a_t = a]. \]

Actor–critic обучает policy (actor) и value estimates (critic) одновременно.

4.3. Deep reinforcement learning

High-dimensional state space требует neural function approximators. Challenges: correlated sequential data, moving targets — mitigated через experience replay, target networks, stochastic optimization.

4.4. Representation learning для sequential data

LSTM захватывает temporal dependencies через gating; Transformers — через self-attention over history window.

4.5. Portfolio allocation как sequential control

Portfolio weights $\mathbf{w}_t = (w_{1,t}, \ldots, w_{N_t,t})$ при constraint $\sum_i w_{i,t} = 1$, $w_{i,t} \geq 0$. Realized return:

\[ R_{p,t+1} = \sum_{i=1}^{N_t} w_{i,t} R_{i,t+1}. \]

Transaction costs создают trade-off responsiveness vs turnover; reward function отражает performance net of frictions. Рис. 4 — loop agent–environment.

Рисунок 4
Рисунок 4. Схема взаимодействия RL-агента с рыночной средой.

5. Методология

Раздел описывает methodological framework RL-based portfolio allocation: state representation, action space, reward, SAC architecture, конфигурации, WFO с adaptive retraining, метрики и бенчмарки.

5.1. Представление состояния

State включает asset-level и global market features для cross-sectional и absolute signals. Перед подачей в агента — cross-sectional selection top-$k$ по 120-day momentum ($k \in \{20, 30\}$ или $\{10, 20\}$ в NC-конфигурациях):

\[ m_{i,t}^{(120)} = \frac{P_{i,t}}{P_{i,t-120}} - 1. \]

5.1.1. Momentum. Log-returns на горизонтах $X \in \{1, 5, 20, 60\}$:

\[ r_{i,t}^{(X)} = \log\!\left(\frac{P_{i,t}}{P_{i,t-X}}\right). \]

5.1.2. Volatility. Rolling standard deviation log-returns на $X \in \{5, 20\}$:

\[ \sigma_{i,t}^{(X)} = \sqrt{\frac{1}{X}\sum_{j=1}^{X}(r_{i,t-j} - \bar{r}_{i,t})^2}. \]

5.1.3. Technical indicators. RSI, MACD histogram, Bollinger %B, distance from 20-day high, mean-reversion signal от 20-day MA.

5.1.4. Market-relative. Rolling 60-day beta к market proxy (QQQ/FEZ/EWJ); 20-day log return как absolute performance.

5.1.5. Global features. VIX и его 5-day change; cross-sectional average return tradable assets и 5-day rolling vol; market breadth (доля активов с positive medium-term returns); normalized proxy returns на 5 и 20 дней.

5.1.6. Dynamic universe. Top-$k$ momentum selection фиксирует размерность state vector при time-varying $N_t$ (рис. 2).

5.2. Пространство действий

Action $a_t = \mathbf{w}_t = (w_{1,t}, \ldots, w_{N_t,t}, w_t^c)$ — веса активов и cash. Constraint:

\[ \sum_{i=1}^{N_t} w_{i,t} + w_t^c = 1. \]

Policy outputs параметры Dirichlet distribution; sampling даёт non-negative weights, сумма = 1. Flat: один Dirichlet на все активы + cash. Hierarchical: сначала equity vs cash, затем Dirichlet на equity portion. Конфигурации: fully invested long-only или flexible cash exposure.

5.3. Функция вознаграждения

Reward балансирует performance, trading frictions и diversification. Net portfolio log-return:

\[ \tilde{r}_{p,t} = \log(1 + r_{p,t}^{\text{net}}). \]

Herfindahl–Hirschman Index (HHI) концентрации:

\[ \text{HHI}_t = \sum_{i=1}^{N_t} w_{i,t}^2, \quad \text{HHI}_t^{\min} = 1/N_t. \]

Absolute reward:

\[ r_t = 1000 \cdot \tilde{r}_{p,t} - \lambda_{\text{TO}} \cdot \text{TO}_t \cdot 100 - \lambda_{\text{conc}} \cdot (\text{HHI}_t - \text{HHI}_t^{\min}) \cdot 100. \]

Benchmark-relative reward:

\[ r_t = 1000 \cdot (\tilde{r}_{p,t} - \tilde{r}_{b,t}) - \lambda_{\text{TO}} \cdot \text{TO}_t \cdot 100 - \lambda_{\text{conc}} \cdot (\text{HHI}_t - \text{HHI}_t^{\min}) \cdot 100. \]

Turnover $\text{TO}_t$ — L1 distance между consecutive weight vectors. Transaction costs в $r_{p,t}^{\text{net}}$; turnover penalty — дополнительная regularization. Scaling factors стабилизируют gradients. Рис. 5 — декомпозиция reward.

Рисунок 5
Рисунок 5. Декомпозиция функции вознаграждения.

5.4. Архитектура модели (SAC)

5.4.1. Soft Actor–Critic. Off-policy actor–critic с entropy regularization для exploration и stable learning. Twin critics mitigates overestimation bias; experience replay decorrelates training data. Soft target updates: $\theta^- \leftarrow \tau\theta + (1-\tau)\theta^-$, $\tau = 0.005$. Entropy coefficient $\alpha = 0.2$ held fixed — adaptive tuning introduced instability across WFO folds из-за non-stationarity financial returns и коротких validation windows; fixed $\alpha$ ensures reproducible exploration-exploitation trade-off.

5.4.2. State encoding. Asset-level features encoded individually; historical sequence summarized LSTM (hidden 64/128) или Transformer (128 dim, 2 layers self-attention). Embeddings combined cross-sectional attention mechanism — captures inter-asset relationships. Transformer config (TRANSFORMERS) replaces LSTM for comparison temporal representation capacity.

5.4.3. Policy network. Encoded state → Dirichlet concentration parameters → sampled weight vector on simplex. Flat: single Dirichlet over all assets + cash. Hierarchical (LSTM_2): (1) Bernoulli/continuous split equity vs cash; (2) Dirichlet on equity subset — separates macro allocation from security selection, principled dynamic cash management within SAC.

5.4.4. Critic networks. Two independent Q-networks input (encoded state, action) → scalar Q-value; minimum of twin estimates used for target computation (standard SAC). Stabilizes training in noisy financial reward landscapes.

5.5. Пять конфигураций SAC

Табл. 3 — overview всех конфигураций (общая feature representation, различия в encoder, policy, reward, constraints, top-$k$):

Таблица 3. Обзор конфигураций reinforcement learning.
КонфигурацияЭнкодерПолитикаRewardОграниченияTop-k
LSTM_1LSTMFlat DirichletLog-returnCash + гибкая экспозиция20 / 30
LSTM_2LSTMHierarchicalLog-returnCash + гибкая экспозиция20 / 30
LSTM_NC_1LSTMFlat DirichletBenchmark-relativeFully invested (без cash)10 / 20
LSTM_NC_2LSTMFlat DirichletBenchmark-relativeFully invested (без cash)20
TRANSFORMERSTransformerFlat DirichletLog-returnCash + гибкая экспозиция20 / 30

Табл. 4 — общие hyperparameters SAC:

Таблица 4. Гиперпараметры RL и оптимизации.
ПараметрЗначение
Learning rate (actor)$3 \times 10^{-4}$
Learning rate (critic)$5 \times 10^{-4}$
Learning rate (entropy)$3 \times 10^{-4}$
Discount factor $\gamma$0,99
Target smoothing $\tau$0,005
Gradient steps2
Batch size128
Replay buffer size20 000
Warm-up steps500
Entropy coefficient $\alpha$0,2 (fixed)

Environment parameters (из PDF табл. 5–6): lookback 60 дней; transaction cost 2 bps (нижняя граница IBKR institutional tier, 0,05–0,35 bps/share по tiered schedule); turnover penalty $\lambda_{\text{TO}} = 0{,}003$; concentration penalty $\lambda_{\text{conc}} \in \{0{,}0;\ 0{,}1;\ 0{,}5\}$ config-dependent; max 50 epochs, early stopping patience 8, warm-up 500 steps. LSTM hidden 64/128 (1 layer); Transformer hidden 128 (2 self-attention layers).

5.6. Процедура обучения и validation

5.6.1. Walk-forward optimization. Non-anchored WFO (Carta et al., 2021): rolling windows фиксированной длины — 5 лет train, 1 год validation, 1 год test, 16 фолдов (рис. 6). Anchored WFO (expanding train window) отвергнут: non-anchored лучше reflects realistic portfolio management с constant training horizon. k-fold CV неприменим — нарушает temporal ordering, даёт optimistic estimates.

WFO simulates deployment: train on history → select hyperparameters on validation → evaluate strictly OOS on test. Cumulative dark-red bars на рис. 6 — full OOS period 2009–2026. Параметры WFO (5/1/1, adaptive retraining) не оптимизировались ex-post (Bailey et al., 2017 — meta-overfitting risk).

5.6.2. Adaptive retraining. На fold 1 модель always trained (cold start). На fold $k$ validation Sharpe:

\[ S_k = \frac{\bar{r}_k}{\sigma_k}\sqrt{252}. \]

Порог: $\theta_k = \text{median}(S_{k-m}, \ldots, S_{k-1}) - \frac{1}{2}\text{std}(S_{k-m}, \ldots, S_{k-1})$, $m=5$. For $k < 3$ threshold undefined — always retrain. Retraining triggers: $S_k < 0$; $S_k < \theta_k$; или >3 consecutive folds without retraining. Otherwise carry forward previous weights — reduces ~40% compute vs naive always-retrain while mimicking production monitoring.

5.6.3. Hyperparameter selection. На каждом train window — grid candidate configs; selection по validation Sharpe с monthly aggregation returns для noise reduction. Приоритет: согласованность train/validation performance.

Рисунок 6
Рисунок 6. Walk-forward optimization: 5 лет обучения, 1 год валидации, 1 год теста (16 фолдов). Зелёный — train, жёлтый — validation, красный — OOS test.

5.7. Computational setup

Эксперименты на cloud GPU NVIDIA L4 (24 GB VRAM), 30 GB RAM. LSTM agent ~14 ч на WFO cycle; Transformer ~23 ч из-за self-attention.

5.8. Метрики производительности

Primary metric — Modified Information Ratio IR2 (drawdown-aware risk-adjusted return). Также: ARC, ASD, MD, MLD, Sharpe (SR), IR1 $= \text{ARC}/\text{ASD}$, IR3, average daily turnover (ADT).

ARC (annualized compounded return):

\[ \text{ARC} = \left(\prod_{t=1}^{N}(1+R_t)\right)^{252/N} - 1. \]

Modified IR2 (primary):

\[ \text{IR2} = \text{IR1} \times \frac{\text{ARC} \times \text{sign}(\text{ARC})}{\text{MD}}. \]

Extended Information Ratio IR3 одновременно penalizes volatility, MD и MLD:

\[ \text{IR3} = \frac{\text{ARC}^3}{\text{ASD} \times \text{MD} \times \text{MLD}}. \]

Maximum Drawdown MD — max percentage decline от peak; Maximum Loss Duration MLD — longest period (years) между consecutive local equity maxima (Michańków et al., 2022).

Portfolio turnover (ADT — average over evaluation period):

\[ \text{TO}_t = \sum_{i=1}^{N_t}|w_{i,t} - w_{i,t}^-| + |w_t^c - w_t^{c,-}|. \]

Sharpe Ratio: $\text{SR} = \bar{R}/\sigma_R \cdot \sqrt{252}$. Transaction costs proportional to turnover; ADT reflects economic feasibility стратегии.

5.9. Бенчмарк-стратегии

Buy & Hold — QQQ / EWJ / FEZ без rebalancing, без transaction costs; главная планка (DeMiguel et al., 2009). Outperform passive B&H on risk-adjusted basis — высокая планка в empirical portfolio research.

Momentum Top-20 — at each rebalancing date equal weight top 20 assets по 120-day price momentum. Isolates value added RL allocation policy beyond simple momentum pre-selection. На Nasdaq — high turnover (ADT 36%) и weak IR2; на Euro Stoxx 2020–2026 — near collapse.

Equal-Weight Monthly — uniform allocation в том же top-$k$ universe что RL agent, monthly rebalance. Если equal-weight ≈ RL, primary driver — momentum filter, не learned policy (DeMiguel et al., 2009).

Markowitz Min Variance — 5-year rolling training window для covariance; constrained min-variance (long-only, fully invested, max position size); monthly rebalance (21 trading days). Direct comparison RL vs classical optimization при identical data constraints.

5.10. Резюме методологии

Pipeline: data preprocessing → features → SAC training (WFO + adaptive retraining) → OOS portfolio allocations → metrics. Economic view: dynamic allocation, balancing return, risk, costs через reward penalties. Рис. 7 — end-to-end workflow.

Рисунок 7
Рисунок 7. Обзор методологии исследования динамического распределения портфеля.

6. Эмпирические результаты

Для каждого рынка — три панели RL (LSTM+cash, LSTM NC, Transformer) vs четыре бенчмарка (раздел 5.9). Primary selection criterion — IR2; главная планка — Buy & Hold. OOS period начинается 2009-04-06. Trading по трём индексам параллельно в единой WFO-процедure.

6.1. Nasdaq-100

Рис. 8 — equity curves. Buy & Hold и Equal-Weight Monthly показывают strongest long-term growth; RL consistently ниже passive benchmarks. LSTM_NC_1 — highest absolute return among RL, но с elevated volatility и drawdown. Transformer не даёт clear advantage над LSTM.

Табл. 7 (Panel A, LSTM+cash): B&H IR2 = 0,518; Equal-Weight 0,493; Markowitz 0,466; лучший RL — LSTM_2 (IR2 = 0,455, ASD = 18,67%, MD = 28,77%). Momentum Top-20 — weakest IR2 (0,176) при ADT = 36,2%.

Вывод: на Nasdaq-100 persistent bull trend систематически favor passive allocation; active RL не превосходит B&H по IR2 на полной OOS-выборке. Panel B: LSTM_NC_1 highest AR among all RL (1666% cumulative) но IR2 0,389 < LSTM_2 0,455 — quantifies cost of forbidding cash. Panel C: Transformer IR2 0,441 ≈ LSTM_1 0,443 без improvement from attention encoder на US growth stocks.

Рисунок 8
Рисунок 8. Эмпирические результаты для Nasdaq-100 (панели A: LSTM+cash; B: LSTM NC; C: Transformer).
Таблица 7. Метрики производительности — Nasdaq-100 (выборка строк; полная таблица — PDF).
СтратегияARC (%)ASD (%)MD (%)IR2SharpeADT
Panel A: LSTM + cash
Buy & Hold19,2720,4135,120,5180,9690,000
Equal-Weight Monthly18,1320,4732,550,4930,9190,326
Markowitz Min Var16,6519,1831,000,4660,8980,214
LSTM_117,6121,6332,340,4430,86213,782
LSTM_215,6418,6728,770,4550,87613,951
Momentum Top-2012,2721,6539,550,1760,64636,159
Panel B: LSTM NC (fully invested)
LSTM_NC_119,7024,2041,230,3890,86816,326
LSTM_NC_218,5122,6333,950,4460,86814,782
Panel C: Transformer
TRANSFORMERS17,4621,4332,270,4410,86214,248

6.2. Nikkei 225

Рис. 9: Markowitz и Equal-Weight substantially outperform B&H и RL. B&H — weakest (ARC 4,57%, MLD 11,345 лет recovery после GFC). Among RL — LSTM_1 best (IR2 = 0,154, IR3 = 2,50).

Рисунок 9
Рисунок 9. Эмпирические результаты для Nikkei 225.
Таблица 8. Метрики производительности — Nikkei 225.
СтратегияARC (%)ASD (%)MD (%)MLDIR2SharpeADT
Panel A: LSTM + cash
Buy & Hold4,5720,4155,8011,3450,0180,3190,000
Equal-Weight Monthly12,4020,8639,333,0600,1870,6630,261
Markowitz Min Var13,1721,7646,231,0480,1720,6770,239
LSTM_111,2220,9639,090,6900,1540,61123,497
LSTM_29,1218,3738,270,5710,1180,56518,858
Panel B: LSTM NC
LSTM_NC_19,1124,1553,070,6900,0650,48120,789
LSTM_NC_29,2223,7249,980,6900,0720,49020,036
Panel C: Transformer
TRANSFORMERS9,0921,4738,830,6900,0990,51120,650

На Nikkei 225 Markowitz достигает highest ARC (13,17%) и IR1 (0,605); Equal-Weight Monthly — highest IR2 (0,187). LSTM_1 среди RL — best IR2 (0,154) с MLD 0,690 years. B&H catastrophic MLD (11,345) — decade-long recovery после GFC. Panel B NC configs не улучшают Panel A — подтверждает RQ3. Naive diversification и min-variance add substantial value vs passive index; RL beats B&H, но не consistently matches classical benchmarks.

6.3. Euro Stoxx 50

Рис. 10 — наиболее favorable market для RL. Equal-Weight лидирует по ARC (10,24%); among RL — LSTM_2 (IR2 = 0,146, ASD = 15,97%, MD = 29,94%). Все RL configurations outperform B&H по IR2 — в отличие от Nasdaq и Nikkei. Lower trend persistence European market conducive к active allocation.

Panel A: LSTM_2 tracks leading benchmarks with smoother growth than FEZ buy-and-hold. Panel B: fully invested NC configs underperform Panel A but remain above B&H. Panel C: Transformer competitive, closely tracking LSTM_1. Markowitz — lowest MLD (0,413) и ADT (0,172). Regression intercepts significant для LSTM_1, LSTM_2, LSTM_NC_2, Transformer — evidence abnormal returns vs FEZ even after HAC correction (табл. 11 PDF).

Рисунок 10
Рисунок 10. Эмпирические результаты для Euro Stoxx 50.
Таблица 9. Метрики производительности — Euro Stoxx 50.
СтратегияARC (%)ASD (%)MD (%)IR2SharpeADT
Panel A: LSTM + cash
Buy & Hold7,8123,9239,690,0640,4330,000
Equal-Weight Monthly10,2420,6339,400,1290,5740,859
Markowitz Min Var9,1118,3136,240,1250,5650,172
LSTM_18,5518,7133,520,1170,53010,613
LSTM_28,3615,9729,940,1460,58111,416
Momentum Top-207,2221,0733,370,0740,43539,184
Panel B: LSTM NC
LSTM_NC_17,2319,8734,490,0760,44915,661
LSTM_NC_28,6419,5234,500,1110,52012,697
Panel C: Transformer
TRANSFORMERS8,7118,7833,160,1220,5378,418

6.4. Статистическая значимость

Competitive IR2 недостаточно — нужен formal inference. Daily returns violate i.i.d. assumptions: autocorrelation, heteroskedasticity (volatility clustering), heavy tails. Conventional paired t-tests underestimate standard errors.

HAC inference (Newey & West, 1987): robust standard errors для mean return differences $\mu_d = \mu_{\text{strategy}} - \mu_{\text{B&H}}$. Null: $H_0: \mu_d = 0$ vs $H_1: \mu_d > 0$ at 10% level.

Stationary bootstrap (Politis & Romano, 1994): empirical distributions Sharpe и IR2 differences без parametric assumptions — complements HAC for risk-adjusted metrics.

Regression abnormal returns:

\[ R_t^{\text{strategy}} = \alpha + \beta R_t^{\text{benchmark}} + \epsilon_t, \]

$H_0: \alpha = 0$ vs $H_1: \alpha > 0$ with Newey–West HAC standard errors on $\alpha$.

Табл. 10: ни одна RL strategy не достигает HAC-significant excess return vs B&H по mean differences на всех рынках. Regression (табл. 11 PDF): significant positive $\alpha$ at 10% для LSTM_1, LSTM_2, Transformer на Euro Stoxx 50 only.

Таблица 10. HAC-adjusted и bootstrap statistical significance (p-values).
МодельMean Diff.HAC p-val$\Delta$Sharpe p-val$\Delta$IR2 p-val
Panel A: Nasdaq-100
LSTM_1−0,00000,66540,83220,7872
LSTM_2−0,00010,94890,77620,7502
Transformer−0,00000,69680,82820,7882
LSTM-NC-10,00010,31290,78320,7313
LSTM-NC-20,00000,49140,80620,7672
Panel B: Nikkei 225
LSTM_10,00000,33810,35560,3636
LSTM_2−0,00010,69490,50050,4725
LSTM-NC-1−0,00000,50060,74030,7612
LSTM-NC-2−0,00000,50250,72130,7273
Transformer−0,00000,60340,69130,6903
Panel C: Euro Stoxx 50
LSTM_10,00000,49920,15380,1349
LSTM_2−0,00000,58400,07190,0619
LSTM-NC-1−0,00000,62630,40860,3786
LSTM-NC-20,00000,46650,19280,1608
Transformer0,00000,47580,13990,1229

Итог раздела 6: performance varies substantially across indices; Euro Stoxx — best RL environment; fully invested configs — higher AR, lower IR2; cash improves drawdown control; hypothesis partially supported.

6.5. Сводка эмпирических результатов

По IR2 лучшие RL per market: Nasdaq — LSTM_2 (0,455), но ниже B&H (0,518) и Equal-Weight (0,493); Nikkei — LSTM_1 (0,154), ниже Equal-Weight (0,187) и Markowitz (0,172 по IR2, 0,605 по IR1); Euro Stoxx — LSTM_2 (0,146), все RL > B&H (0,064). Fully invested LSTM_NC_1 на Nasdaq даёт AR 1666% при IR2 0,389 — иллюстрация trade-off absolute vs risk-adjusted return.

HAC tests (табл. 10): no strategy achieves significant mean excess vs B&H at 10%. Regression intercepts significant для LSTM_1 ($\alpha$ p = 0,033), LSTM_2 (p = 0,012), LSTM_NC_2 (p = 0,042), Transformer (p = 0,029) на Euro Stoxx only. Findings exploratory — RL may capture market-specific inefficiencies, но not robust global outperformance.

7. Анализ режимов

Aggregate full-sample metrics могут conceal regime-dependent performance. Section 7 decomposes OOS evaluation into three macroeconomic regimes with separate performance tables (12–14 в PDF). Methodology: same strategies, same metrics (IR2 primary), subset dates per regime. Buy & Hold benchmark per market: QQQ (Nasdaq), EWJ (Nikkei), FEZ (Euro Stoxx).

Aggregate results могут mask heterogeneous performance. Период декомпозирован на три макроэкономических режима (табл. 12–14 PDF):

Nasdaq-100 (табл. 12 PDF): 2009–2013 — Markowitz IR2 = 2,87, LSTM_2 = 2,01, B&H = 1,95; RL beat B&H. 2014–2019 — B&H IR2 = 0,82, Equal-Weight = 0,85, LSTM_2 = 0,62; passive dominates. 2020–2026 — B&H IR2 = 0,28, Equal-Weight = 0,17; Momentum Top-20 IR2 = 0,03 (collapse).

Nikkei 225 (табл. 13 PDF): 2009–2013 — Equal-Weight IR2 = 0,48, Markowitz = 0,35, B&H = 0,018. 2014–2019 — LSTM_2 IR2 = 0,62 (leads all strategies). 2020–2026 — Markowitz IR2 = 0,20, LSTM_2 = 0,17, B&H = 0,063.

Euro Stoxx 50 (табл. 14 PDF): 2009–2013 — Momentum Top-20 IR2 = 0,40. 2014–2019 — Markowitz IR2 = 0,25, LSTM_2 = 0,20. 2020–2026 — LSTM_2 IR2 = 0,10 (highest among all), Momentum IR2 ≈ 0,0001 (near collapse).

Общий вывод: no single strategy type dominates все markets/regimes. RL adds value vs B&H на Nikkei и Euro Stoxx в several settings, но не consistently beats Equal-Weight и Markowitz. Regime-dependence критична для evaluation active strategies.

8. Ансамбль total fund

Ensemble framework: equal-weight aggregation OOS daily returns Nasdaq-100 + Nikkei 225 + Euro Stoxx 50 для каждой RL configuration. Common date index с 2009-04-06. Benchmark — cross-sectional average B&H трёх рынков.

Рис. 11 — equity curves (growth of 1 unit capital). LSTM_1 — strongest absolute growth. Табл. 15 — metrics:

Таблица 15. Метрики ансамблевых cross-asset портфелей.
СтратегияAR (%)ARC (%)ASD (%)MD (%)MLDIR1IR2Sharpe
Common Benchmark (avg B&H)486,7912,6816,5328,631,700,7670,3400,806
LSTM_1514,6013,0314,7228,161,790,8850,4100,906
LSTM_2390,4911,3312,7525,461,750,8890,3950,905
LSTM_NC_1487,8412,6916,1428,761,980,7860,3470,822
LSTM_NC_2483,4412,6415,7628,771,790,8020,3520,834
TRANSFORMERS451,3212,2114,7727,921,770,8270,3620,854

LSTM_1 — highest IR2 (0,410) vs benchmark (0,340); also highest AR (514,6%) и ARC (13,03%). LSTM_2 — lowest ASD (12,75%) и MD (25,46%) among all strategies — superior risk control at slightly lower IR2 (0,395). NC configurations track benchmark closely (IR2 ≈ 0,347–0,352). TRANSFORMERS — competitive (IR2 0,362) с lower ADT implied turnover on Euro Stoxx panel.

Statistical assessment (табл. 16 PDF): HAC mean-diff p-values 0,49–0,83 — no significant excess returns. Bootstrap $\Delta$Sharpe p-values 0,18–0,34; $\Delta$IR2 p-values 0,25–0,49. Regression: LSTM_1 intercept p = 0,0496; LSTM_2 p = 0,0481 (significant at 10%) — partial evidence abnormal performance in ensemble, analogous Euro Stoxx single-market regression results. Economic improvement clear; statistical evidence limited — interpret as indicative.

Ensemble confirms RQ5: geographic diversification across US, Japan, Europe reduces single-market regime risk and improves aggregate IR2 relative to average passive exposure.

Рисунок 11
Рисунок 11. Кривые капитала ансамблевых кросс-рыночных портфелей (equal-weight по трём индексам).

9. Обсуждение

Цель — оценить, улучшают ли RL portfolio strategies risk-adjusted performance при realistic constraints. SAC agents с architectural/economic variants vs четыре бенчмарка в WFO framework.

Табл. 7–9: effectiveness varies significantly. Strongest RL results — Euro Stoxx 50 (all RL > B&H по IR2). Nasdaq и Nikkei — passive/classical competitive or dominant. Equal-Weight Monthly и Markowitz Min Variance трудно beat consistently (DeMiguel et al., 2009).

Ensemble (табл. 15): LSTM_1 IR2 = 0,41 vs benchmark 0,34 — cross-market diversification benefits. Momentum Top-20 — high turnover, weak IR2 на Nasdaq; momentum breaks Euro Stoxx 2020–2026.

Central hypothesis — partially supported. HAC (табл. 10): no significant excess vs B&H globally; regression — abnormal returns Euro Stoxx only. Regime analysis: RL most valuable при elevated uncertainty, lower trend persistence.

RQ1 (reward formulation): benchmark-relative (LSTM_NC) не consistently dominates absolute-return models — exploratory, not ceteris paribus (reward co-varies с constraints).

RQ2 (policy structure): hierarchical LSTM_2 — lower volatility и MD vs LSTM_1 на всех рынках; decomposing equity-cash vs asset selection improves stability.

RQ3 (constraints): cash-allowed configs — higher IR2, lower drawdowns; fully invested — higher AR, worse risk-adjusted (видно на Nasdaq: LSTM_NC_1 AR 1666% vs IR2 0,39).

RQ4 (encoder): LSTM ≥ Transformer по IR2 на всех рынках; Transformer competitive absolute returns, но не superior stability.

RQ5 (ensemble): all ensemble configs beat common benchmark IR2; LSTM_1 strongest; reduced vol/MD vs single-market.

RQ6 (regimes): RL beats B&H на Nikkei/Euro Stoxx в multiple regimes; Nasdaq — RL only post-GFC; strongly trending markets favor passive.

Сложность systematic outperformance согласуется с DeMiguel et al. (2009): estimation error в expected returns и covariances limits practical edge sophisticated models; equal-weight (здесь — momentum-filtered monthly rebalance) остаётся formidable benchmark. RL strategies несут ADT 8–40% vs 0% B&H — conservative 2 bps assumption может underestimate real costs для high-turnover configs.

Практический вывод: RL наиболее перспективен как компонент geographically diversified program (ensemble LSTM_1, IR2 0,41) и active overlay на European equities (Euro Stoxx); standalone deployment на Nasdaq bull market не justified по IR2 и HAC tests.

10. Заключение

Разработан unified DRL framework для dynamic portfolio allocation на Nasdaq-100, Nikkei 225 и Euro Stoxx 50: SAC + WFO + adaptive retraining + realistic frictions; 5 configurations; 16 OOS folds; primary metric IR2; 4 benchmarks.

Empirical findings: competitive risk-adjusted performance на Euro Stoxx и в ensemble (LSTM_1 IR2 0,41 vs 0,34); hypothesis partially confirmed — no consistent beat of passive/classical across all markets; no HAC-significant excess vs B&H on mean returns; regime analysis — RL valuable при uncertainty, passive dominates strong trends (Nasdaq 2014–2019).

Contributions in detail: (1) unified multi-market WFO enables direct comparison US vs Japan vs Europe under identical SAC pipeline — absent in Yang et al. (2020) и Jiang et al. (2024) single-market designs; (2) hierarchical Dirichlet extends flat policies in Hambly et al. (2023) survey with explicit equity-cash separation; (3) adaptive retraining reduces compute vs naive retrain-every-fold while preserving deployment realism; (4) regime decomposition provides actionable guidance when to deploy active RL vs passive beta.

Limitations: no significant outperformance 2/3 markets on HAC mean-return tests; configs not ceteris paribus ablations (encoder, reward, constraints co-vary); fixed 2 bps costs without retraining under higher costs; WFO parameters (5/1/1, retraining threshold) not sensitivity-tested — meta-overfitting risk (Bailey et al., 2017); equal-weight ensemble only, not optimal cross-market allocation.

Despite limitations, work demonstrates that SAC-based dynamic allocation with hierarchical policies, adaptive retraining и multi-market WFO produces economically interpretable strategies competitive with classical benchmarks in selected markets and materially improved via geographic ensemble diversification.

Future work: high-frequency data и crypto (microstructure, liquidity, intraday costs); macro features (yield curve, credit spreads, PMI) + LLM news embeddings для richer regime characterization; meta-ensemble с learnable cross-market weights; dedicated ceteris paribus ablation varying one dimension at a time (reward, policy, encoder).

Таблицы и дополнительные детали

На этой странице воспроизведены ключевые таблицы из 67-страничного PDF. Полные sub-period tables (12–14), regression table 11 и ensemble statistics table 16 доступны только в оригинале.

Таблица 1 — descriptive statistics closing prices (2003–2026): Nasdaq count 5836 obs, mean 154; Nikkei 5676 obs, mean 51; Euro Stoxx 5836 obs, mean 30.

Таблица 2 — daily log-returns: Nasdaq std 0,0136, excess kurtosis 7,13; Nikkei std 0,0128, kurtosis 8,62; Euro Stoxx std 0,0159, kurtosis 9,90.

Таблицы 5–6 — encoder architecture (LSTM 64/128 hidden, Transformer 128×2 layers) и environment params (lookback 60, cost 2 bps, turnover penalty 0,003, epochs 50, patience 8).

Таблицы 12–14 — sub-period IR2 по трём режимам для каждого индекса; bold — best per metric per period в PDF.

Таблица 11 — regression $\alpha$ (HAC): significant at 10% для Euro Stoxx LSTM_1 (p=0,033), LSTM_2 (p=0,012), LSTM_NC_2 (p=0,042), Transformer (p=0,029); Nasdaq и Nikkei — no significant $\alpha$.

Таблица 16 — ensemble HAC/bootstrap: LSTM_1/LSTM_2 regression intercepts significant (p ≈ 0,049); mean-diff HAC not significant.

Примечания к рисункам 1–11

Рис. 1 — normalized price paths всех constituent assets; red line — benchmark ETF (non-normalized scale). Три панели по индексам.

Рис. 2 — evolution числа tradable stocks во времени (survivorship-aware universe); Nasdaq ~95–105, Nikkei ~223–225, Euro Stoxx ~46–50 constituents.

Рис. 3 — data pipeline: Bloomberg membership + yfinance prices → tradable mask → model dataset.

Рис. 4 — RL agent loop: observe $s_t$ → action $a_t \sim \pi_\theta(\cdot|s_t)$ → reward → transition $s_{t+1}$.

Рис. 5 — reward decomposition: log-return component, turnover penalty, concentration penalty (HHI).

Рис. 6 — 16 WFO folds: green train (5y), yellow validation (1y), red test (1y); cumulative OOS dark-red bar.

Рис. 7 — full methodology workflow from preprocessing through SAC training to OOS evaluation.

Рис. 8–10 — equity curves Nasdaq, Nikkei, Euro Stoxx; three panels each (LSTM+cash, LSTM NC, Transformer) vs four benchmarks.

Рис. 11 — cross-asset ensemble equity curves; equal-weight combination of per-market strategy returns; benchmark = average B&H.

Полный PDF (67 стр., arxiv.org/pdf/2605.17307)

Central hypothesis — partially supported. Euro Stoxx и ensemble LSTM_1 — strongest economic cases; HAC inference limits causal claims on alpha.

Документ охватывает полную структуру 67-страничной работы: введение, literature review (§2.1–2.5), data (§3.1–3.3), theory (§4.1–4.5), methodology (§5.1–5.10), results (§6.1–6.5), regimes (§7), ensemble (§8), discussion (§9), conclusion (§10). Таблицы 3, 4, 7–10, 15 воспроизведены inline; остальные — по ссылке на PDF.

Краткая сводка пяти SAC-конфигураций:

Primary OOS evaluation metric throughout: IR2 (Modified Information Ratio). Trading start date aligned across markets: 2009-04-06. Full sample data: 2003-01-02 — 2026-03-13.

Литература

Оригинал: arXiv:2605.17307 (PDF, 67 стр.). Перевод и адаптация для каталога маркетмейкинга — полный пересказ основного текста; численные значения сверены с PDF от 17 мая 2026.