Статистический арбитраж в мультипарной торговой стратегии на основе алгоритмов кластеризации графов на рынке акций США

6.5/10

Adam Korniejczuk · Faculty of Economic Sciences, University of Warsaw, ul. Długa 44/50, 00-241, Warsaw, Poland · a.korniejczu@student.uw.edu.pl (corresponding author)

Robert Ślepaczuk · Quantitative Finance Research Group, Department of Quantitative Finance, Faculty of Economic Sciences, University of Warsaw · rslepaczuk@wne.uw.edu.pl

15 июня 2024 · ORCID: 0000-0001-5227-2014

Оригинал: Korniejczuk, A. and Ślepaczuk, R. «Statistical arbitrage in multi-pair trading strategy based on graph clustering algorithms in US equities market», v1 — arxiv.org/abs/2406.10695 (PDF, 33 стр.).

Рис. 1–16 воспроизведены из оригинальной публикации.

Ключевые слова: Statistical Arbitrage, Graph Clustering, Machine Learning, Kelly Criterion, S&P 500.

Классификация arXiv: q-fin.PM

Аннотация

Исследование направлено на разработку эффективной стратегии в рамках нового подхода к статистическому арбитражу на основе алгоритмов кластеризации графов. Для улучшения доходности с поправкой на риск и повышения устойчивости к транзакционным издержкам по сравнению с существующими методами использованы количественные и машинно-обучающие техники, включая критерий Кelly и ансамбль классификаторов. Работа предлагает интегрированный подход к оптимальному обнаружению сигналов и управлению риском. В рамках этого подхода предложены и протестированы новые способы оптимизации функций take profit и stop loss для дневных торговых стратегий. Все протестированные подходы превзошли соответствующие бенчмарки. Лучшие комбинации техник и параметров показали значительно лучшие метрики производительности, чем релевантные бенчмарки. Результаты получены при реалистичных транзакционных издержках, но чувствительны к изменению некоторых ключевых параметров.

1. Введение

Цель исследования — разработать эффективную алгоритмическую торговую стратегию на основе нового фреймворка статистического арбитража с алгоритмами кластеризации графов. Задача важна, поскольку работа вносит вклад в растущий корпус исследований применения теории графов в алгоритмическом трейдинге. Детальный анализ производительности стратегии позволит точно оценить сильные и слабые стороны нового подхода. В исследовании классификаторы машинного обучения используются для повышения средней прибыльности исполняемых сделок. Кроме того, в ходе реализации стратегии протестировано множество оптимизаций. Вокруг этого сформулированы четыре исследовательских вопроса:

Исследование основано на дневных данных составляющих S&P 500 с 1 января 2000 по 31 декабря 2022. Для ответа на сформулированные вопросы предложен подход с ансамблевым классификатором качества сигналов, генерируемых графовой стратегией. Отдельные классификаторы обучаются и оптимизируются grid search с кросс-валидацией, затем объединяются в взвешенный ансамбль по результатам на валидационной выборке. Наконец, стратегия с классификаторами, критерием Kelly и новыми функциями stop loss и take profit тестируется на out-of-sample тестовой выборке.

В работе присутствует несколько новшеств. Во-первых, классификаторы ML применяются для фильтрации потенциально прибыльных сигналов, генерируемых другой стратегией — насколько известно, такой подход ранее не реализовывался в алгоритмическом трейдинге, где классификационные модели обычно используют для прогноза направления цен. Во-вторых, введены и протестированы новые зависящие от времени функции stop loss и take profit. Кроме того, модификация этих функций сочетается с масштабированием take profit и stop loss по силе сигнала — нетипичный подход. Исследование изучает потенциал emerging graph-based подхода. Технологический прогресс повысил конкуренцию в количественном трейдинге, усложнив устойчивое получение аномальной доходности и создав потребность в новых сложных методах.

Структура статьи: раздел 1 — введение; раздел 2 — обзор литературы (теория графов и алгоритмический трейдинг, инструменты стратегии); раздел 3 — методология (данные, мотивация, feature engineering, ансамбль классификаторов, оптимизации решений и риск-менеджмента); раздел 4 — метрики и оценка стратегии против бенчмарков с equity curves; раздел 5 — анализ чувствительности; раздел 6 — выводы и направления дальнейших исследований.

2. Обзор литературы

Использование информации о связях между акциями при построении инвестиционных портфелей или алгоритмических стратегий имеет давнюю историю. Логика проста: компании и цены их акций не существуют в вакууме; при неидеальной эффективности рынка информация об одной бумаге может быть полезна при торговле связанными. Влиятельная ранняя работа — Markowitz (1952), заложившая основу современной портфельной теории: корреляция вместе с дисперсией используется для поиска оптимального портфеля с максимальной доходностью при заданном риске.

С тех пор появилось множество стратегий, использующих связи между активами. Простейший подход — группировка по секторам экономики и обобщение поведения секторов. Fama and French (1997) сгруппировали акции в 48 групп по стандартизированным отраслевым кодам для дальнейшего анализа свойств.

Более продвинутые стратегии — pair trading и statistical arbitrage: капитализация на краткосрочном отклонении от установленной связи цен. Для идентификации пар или групп связанных активов применяли коинтеграцию (Kim, 2011), корреляцию (Chen et al., 2019), евклидово расстояние (Gatev et al., 2006), показатель Hurst (Bui and Ślepaczuk, 2022) и их комбинации (Miao, 2014). Однако Bredthauer and Stübinger (2017), протестировав множество комбинаций pair trading из литературы, показали ухудшение производительности большинства стратегий в последнее время — вероятно из-за распространения таких техник. Аналогичные выводы у Do and Faff (2012) и Gatev et al. (2006): арбитражные возможности труднее эксплуатировать, что создаёт потребность в новых сложных подходах.

Среди стратегий на попарных связях быстро растёт и показывает успех graph-based подход. Графы — удобный инструмент дискретной математики для представления отношений между объектами: вершины (nodes) и рёбра (edges). Различают направленный граф — упорядоченную пару \((V, E)\), где \(E \subset V \times V\), — и ненаправленный, где рёбра — подмножество неупорядоченных пар вершин (Zawadowski 2020). Графы могут быть взвешенными (сила связи на ребре) и знаковыми (положительные и отрицательные связи). Важное свойство вершины — степень (degree): сумма весов рёбер, инцидентных вершине. Распространённое представление — матрица смежности: для ненаправленного графа симметричная матрица \(A\) хранит вес ребра между вершинами \(m\) и \(n\) в элементах \(A_{m,n}\) и \(A_{n,m}\). Это согласуется со структурой корреляционной матрицы, поэтому корреляционную матрицу (например, доходностей) можно анализировать graph-based инструментами. Растёт число исследователей, применяющих теорию графов к инвестициям и алгоритмическому трейдингу.

Zhan et al. (2015) показали на neighbor net, что корреляционная кластеризация эффективна для снижения риска при создании портфеля. Li et al. (2022) представили гетерогенный набор (новости, графические индикаторы, транзакции) в виде взвешенного графа и обучили GNN для прогноза волатильности — точность на 14% выше аналогов. Cheng et al. (2022) применили multi-modality GNN для прогноза временных рядов на новостях и рыночных данных с направленными и ненаправленными рёбрами; модель превзошла LSTM-бенчмарки. Yin et al. (2022) использовали Graph Attention LSTM (GALSTM) для прогноза цен акций, достигнув 44,71% годовой доходности и 0,42% дневного стандартного отклонения, хотя система была сильно оптимизирована под китайский рынок A-share и тестировалась лишь 13 недель.

Важное новое исследование graph techniques в алгоритмическом трейдинге — Cartea, Cucuringu and Jin (2023) «Correlation Matrix Clustering for Statistical Arbitrage Portfolios»: первое применение graph clustering для построения стат-арбитражных портфелей. Акции US market — вершины ненаправленного знакового взвешенного графа; корреляции остаточных доходностей за последние 60 дней — веса рёбер; корреляционная матрица — матрица смежности. Тестировались Spectral clustering (Ng et al., 2002), два варианта Signed Laplacian Clustering (Kunegis et al., 2010) и SPONGE (Cucuringu et al., 2019). Три метода выбора числа кластеров: фиксированные 30; минимальное число собственных векторов, объясняющих 90% дисперсии; асимптотика распределения Marchenko–Pastur и теория случайных матриц.

Лучше всего работали варианты со вторым или третьим подходом к числу кластеров и симметричная версия SPONGE — SPONGEsym. Алгоритм SPONGEsym (Cartea et al. 2023) разлагает матрицу смежности \(A\) на \(A^+\) и \(A^-\) (только положительные и отрицательные элементы), вычисляет лапласианы \(L^+ = A^+ - D^+\) и \(L^- = A^- - D^-\), где \(D\) — диагональная матрица степеней. Затем \(L^+_{\mathrm{sym}} = (D^+)^{-\frac{1}{2}} L^+ (D^+)^{-\frac{1}{2}}\) и аналогично \(L^-_{\mathrm{sym}}\). Алгоритм находит \(k\) наименьших обобщённых собственных векторов \((L^+_{\mathrm{sym}} + \tau I, L^-_{\mathrm{sym}} + \tau I)\) и применяет k-means++ в индуцированном \(k\)-мерном евклидовом пространстве.

SPONGEsym превзошёл стратегию с фиксированными кластерами Fama–French по секторам и buy-and-hold: годовая доходность 12,2%, Sharpe 1,1, Sortino 2,01. Реализация стат-арбитража проста — фокус на тесте graph clustering. После кластеризации вычисляется среднее доходностей за последние пять дней по каждому кластеру; long/short открываются на активах с доходностью ниже/выше среднего кластера; процедура повторяется каждые три дня. Оптимизация аллокации и транзакционные издержки в статье не обсуждались. Оптимизация этой стратегии и дальнейшее исследование graph clustering — основной фокус настоящей работы.

Значительный корпус литературы применяет ML-классификаторы для прогноза направления изменения цены. Yangru and Zhang (1997) и Chen et al. (2000) показали, что прогноз направления может быть эффективнее прогноза уровня индексов. Успехи Borovkova (2019), Dixon (2017), Kryńska and Ślepaczuk (2023) подтверждают подход. Bieganowski and Ślepaczuk (2024) продемонстрировали преимущество классификации над регрессией на высокочастотных данных; лучшие результаты — supervised autoencoders с triple barrier labeling.

Worasucheep (2021) показал, что ансамбль ML-классификаторов (ANN, SVM, RF, XGBoost, LightGBM) превосходит и buy-and-hold, и отдельные модели по доходности и Sharpe. Zelenkov (2017) превзошёл бенчмарки ансамблем с взвешенным голосованием, веса оптимизированы генетическим алгоритмом.

Подход с классификаторами для улучшения качества сигналов другой стратегии кажется новым: классификаторы обычно решают buy/sell задачи. Преимущество — возможность risk-weighted решений и построения портфеля через вероятностные оценки модели, например критерий Kelly.

Критерий Kelly (Kelly, 1956) максимизирует ожидаемое значение логарифма богатства; при достаточных допущениях капитал, управляемый по формуле, с вероятностью 1 превзойдёт альтернативы. Thorp (1969) применил Kelly к Blackjack, Roulette и фондовому рынку. Anderson and Faff (2004), Bronakowska et al. (2021), Hagman (2014) показывают улучшение прибыльности; Chen et al. (2021), Li et al. (2020) — успешное применение в алготрейдинге. Есть и противоречивые результаты (Lähteenmäki, 2023).

В заключение: связи между акциями — классический инструмент алготрейдинга; стат-арбитраж и pair trading на корреляции/коинтеграции стали распространённее и менее прибыльны. Graph-based исследования часто показывают отличные результаты, но с сложной архитектурой (GNN, multimodal графы). Cartea et al. (2023) предложили новый graph clustering фреймворк — база настоящего исследования. Фильтрация сигналов по качеству через классификаторы — новшество; ансамбли показали перспективу; история успешного применения Kelly — аргумент для оптимизации стратегии этим инструментом.

3. Методология

3.1. Используемые данные

Данные — из базы Yahoo Finance. Для реалистичности использованы исторические составляющие S&P 500: при бэктесте позиции открывались только на акциях, присутствовавших в индексе на данную дату. История состава — из GitHub-репозитория с изменениями S&P 500 (Farrell 2024). Из-за доступности данных вселенная иногда была меньше 500 бумаг, но на каждый торговый день представлено большинство акций. Для открытия и закрытия позиций использовались скорректированные цены закрытия.

3.2. Метрики производительности

Для детальной оценки стратегии используется полный набор метрик из Cartea et al. (2023) и Bieganowski and Ślepaczuk (2024).

Annualized Return Compounded (ARC) — годовая доходность с реинвестированием:

\[ \mathrm{ARC} = \left(\frac{V_{t_n}}{V_{t_0}}\right)^{\frac{1}{(t_n - t_0)}} - 1 \]

где \((t_n - t_0)\) — длительность инвестирования в годах, \(V_{t_0}\) — начальный капитал, \(V_{t_n}\) — конечный капитал.

Annualized Standard Deviation (ASD) — годовая волатильность как стандартное отклонение дневных доходностей, умноженное на \(\sqrt{252}\):

\[ \mathrm{ASD} = \frac{\sqrt{\sum_{t=1}^{N}(R_t - \hat{R})^2}}{\sqrt{N-1}} \cdot \sqrt{n_{\mathrm{days}}} \]

Information Ratio* (IR*) — для market-neutral стратегии без risk-free rate, с compounded доходностями:

\[ \mathrm{IR}^* = \frac{\mathrm{ARC}}{\mathrm{ASD}} \]

Sortino Ratio (ST) — модифицированный Sharpe с учётом только downside deviation; risk-free rate = 0:

\[ \mathrm{Sortino} = \frac{\mathrm{ARC} - \mathrm{RiskFreeRate}}{\mathrm{Downside\ deviation}} \]

Max Drawdown (MDD) — максимальное падение стоимости портфеля от локального максимума:

\[ \mathrm{MDD} = \max_{\tau \in [0,T]} \left(\max_{t \in [0,\tau]} \frac{V_t - V_\tau}{V_t}\right) \cdot 100\% \]

Max Loss Duration (MLD) — наибольший период (в годах), когда стоимость портфеля ниже любого предыдущего локального максимума: \(\mathrm{MLD} = (t_j - t_i) / n_{\mathrm{obs}}\).

Calmar Ratio (CR): \(\mathrm{CR} = \mathrm{ARC} / \mathrm{MDD}\).

Information Ratio** (IR**) (Kość et al. 2019) — синтетическая мера:

\[ \mathrm{IR}^{**} = \frac{\mathrm{ARC}^2 \cdot \mathrm{sign}(\mathrm{ARC})}{\mathrm{ASD} \cdot \mathrm{MDD}} \]

3.3. Исследование фреймворка — постановка задачи

Исследование основано на стратегии Cartea et al. (2023). Из-за других источников данных и вселенной акций возможны расхождения даже при зеркальной реализации. Для оценки масштаба стратегия протестирована на данных раздела 3.1: собственная реализация на Python 3 повторяет все шаги и параметры. Выбран вариант с SPONGEsym и числом собственных векторов, объясняющих 90% дисперсии. Результаты сгенерированы при транзакционных издержках 0 и 0,05%.

Таблица 1. Сравнение производительности реализаций стратегии и бенчмарка (03.2000–12.2022).
МетрикаOriginalOwn-no-TCOwn-0.05%-TCSPY
AR12,2010,242,446,48
SHARPE1,101,170,280,33
SORTINO2,012,090,490,51

Original — результаты авторов; Own-no-TC — собственная реализация без издержек; Own-0.05%-TC — с издержками 0,05%; SPY — ETF SPY.

Без транзакционных издержек Sharpe, Sortino и годовая доходность близки к Cartea et al. (2023); расхождения могут быть из-за вселенной акций или конвенции расчёта метрик. При издержках 0,05% влияние существенно. Рис. 1–2 показывают equity curves.

Equity curve без транзакционных издержек
Рис. 1. Equity curve собственной реализации без транзакционных издержек. SPY — ETF SPY; Strategy W/o tc — стратегия без издержек.
Equity curve с издержками 0.05%
Рис. 2. Equity curve с транзакционными издержками 0,05%. SPY — ETF SPY; Strategy 0.05% tc — стратегия с издержками 0,05%.

Стратегия очень чувствительна к транзакционным издержкам: периоды слабого роста превращаются в убытки и стагнацию. На рис. 3 сумма издержек в четыре раза превышает чистую прибыль стратегии (рис. 2).

Кривая транзакционных издержек
Рис. 3. Накопленные транзакционные издержки при 0,05%.

Фундаментальное решение — снизить объём торгов. Начальная модификация: ребаланс каждые 10 торговых дней вместо 3; окно lookback для кластеризации увеличено с 5 до 30 дней.

Более глубокое решение: снижение частоты ребаланса уменьшает издержки, но вторична абсолютная величина costs. Значительное падение производительности связано с периодами, когда издержки превышали доход стратегии, создавая многолетние нисходящие тренды. Такие периоды сильнее всего бьют по ARC, downside risk и drawdown — для восстановления от падения на \(x\%\) нужна доходность выше \(x\%\). Решение — улучшить среднее качество сигнала: маргинальные улучшения могут устранить длительные просадки. Поэтому ML-классификаторы идентифицируют сигналы с высокой вероятностью прибыльности, и позиции открываются только при достаточной уверенности.

3.4. Извлечение и инженерия признаков

Для обучения классификаторов нужен датасет, репрезентативный для разных рыночных условий. Первые 1500 торговых дней с 2000 года — train; остальное — out-of-sample test. Признаки основаны на свойствах графа и стандартном ценовом поведении. Активно торгуемый набор акций S&P 500 в данный день — «граф»; выделенный кластер — «подграф».

3.4.1. Признаки на основе графа

Локальная степень вершины: \(\displaystyle\frac{\sum_{n=1}^{S} e_{i,n} - 1}{S - 1}\), где \(e_{i,n}\) — вес \(n\)-го ребра из вершины \(i\), \(S\) — размер подграфа.

Глобальная степень вершины: \(\displaystyle\frac{\sum_{n=1}^{G} e_{i,n} - 1}{G - 1}\), \(G\) — размер графа.

Плотность графа: \(\displaystyle\frac{\sum_{i=1}^{S}\left(\sum_{n=1}^{S} e_{i,n} - 1\right)}{(S-1)S}\).

Размер кластера: \(|v_j| / G\), где \(|v_j|\) — число вершин в \(j\)-м кластере.

Число кластеров: число кластеров (подграфов), делённое на размер графа.

Все graph-based признаки нормированы делением на размер графа или кластера для сопоставимости между кластерами и учёта того, что вселенная не всегда равна 500.

3.4.2. Классические признаки

Датасет создан бэктестом модифицированной стратегии (раздел 3.3) на первых 1500 днях (in-sample, не используется в разделах 4–5). Для каждого сигнала сохранялась запись с признаками и бинарной меткой прибыльности. Два условия прибыльности: (1) кумулятивная доходность к концу торгового дня с последнего ребаланса превышает порог \(T\); (2) к моменту ребаланса кумулятивная доходность превышает транзакционные издержки (нет убытка на позиции).

Выбор \(T\) критичен. Рис. 4 показывает долю сигналов по типам при разных порогах take profit.

Доля сигналов по порогу take profit
Рис. 4. Доля сигналов по типам при разных порогах take profit. Condition 1 met — закрытие по take profit; Condition 2 met — без take profit, но без убытка к следующему ребалансу; No conditions met — убыток; Either condition met — условие 1 или 2. Данные первых 1500 торговых дней.

С ростом \(T\) доля «прибыльных» сигналов медленно сходится к 0,5; наблюдается миграция из condition 1 в condition 2. Для ML близкий к равному баланс классов — благоприятный выбор; слишком высокий \(T\) снижает способность распознавать менее стабильные, но прибыльные сигналы. Выбрано \(T = 4\%\) — близкий к равному split и значительное большинство прибыльных сигналов.

После выбора \(T\) выполнен бэктест с параметрами раздела 3.3. Каждое наблюдение — 14 признаков и бинарная метка прибыльности. Датасет масштабирован MinMax Scaler (sklearn).

3.5. Ансамбль классификаторов качества сигналов

Для максимизации качества классификации обучены пять моделей, затем построен ансамбль. Датасет разделён случайно: 80% train, 20% validation. Grid search cross-validation (GridSearchCV, sklearn); метрика настройки — Brier score loss (качество вероятностных оценок).

Multi-layer Perceptron (MLP) — нативная нейросеть sklearn с softmax; гиперпараметры в табл. 2 (лучшие выделены жирным: 64,32 hidden; tanh; alpha 0,0001; adaptive; batch 100; adam).

Таблица 2. Сетка гиперпараметров MLP.
Hidden layersActivationAlphaLearning rateBatchSolver
64,64 / 64,32 / 64 / 32,16tanh / relu / sigmoid0,1 … 1e-7constant / adaptive50 / 100 / 200sgd / adam

AdaBoost — последовательность слабых классификаторов с перевзвешиванием ошибочных примеров (Freund and Schapire, 1995). Табл. 3: лучшие — 100 estimators, learning rate 0,001.

Таблица 3. Сетка гиперпараметров AdaBoost.
n_estimatorslearning_rate
3 / 5 / 10 / 20 / 50 / 1000,001 / 0,01 / 0,1 / 1 / 10

HistGradientBoosting — gradient-boosted trees sklearn (LightGBM-подобный). Табл. 4: лучшие параметры выделены в оригинале.

Таблица 4. Сетка HistGradientBoosting.
learning_rateearly_stoppingmax_iterwarm_start
0,01 / 0,1 / 0,5 / 1 / 5auto / False50 … 5000 / 1

Stochastic Gradient Descent (SGD) — линейный классификатор с convex loss. Табл. 5.

Таблица 5. Сетка SGD.
LossPenaltyAlphaMax iterEarly stoppingLearning rateWarm start
modified Huber / log / hingel2 / l1 / elastic net0,5 … 0,0011200 / 1000 / 100001 / 0constant / optimal / adaptive / invscaling1 / 0

Logistic regression — табл. 6.

Таблица 6. Сетка логистической регрессии.
CPenaltySolverMax iterClass weightWarm start
0,1 … 20l2 / l1 / elastic netlbfgs / liblinear / newton-cholesky50 … 500Balanced / None1 / 0

После настройки оценена производительность по Brier Score и precision (табл. 7). HistGradientBoosting лучший по обеим метрикам. Все модели с Brier < 0,25 и precision > 0,541 (prevalence положительного класса) превосходят случайный уровень.

Таблица 7. Производительность классификаторов на validation.
ClassifierBrier ScorePrecision
MLP0,2430,568
AdaBoost0,2470,544
HistGradientBoosting0,2180,653
SGD0,2470,547
Logistic Regression0,2490,580

Ансамбль всех пяти моделей — soft voting: HistGradientBoosting с удвоенным весом (вероятности делятся на 3 для HGB и на 6 для остальных, затем суммируются). В анализе чувствительности сравниваются равные веса, утроенный вес лучшей модели и только HistGradientBoosting.

Критичен порог вероятности для принятия сигнала. Наивный 0,5 почти не ограничивает число сделок (рис. 5). Литература предполагает 30–40 акций для диверсификации (Statman 1987); порог, при котором торгуется ~10% сигналов, даёт достаточный портфель. Выбран фиксированный порог \(P_2\): только сигналы с вероятностью выше \(P_2\). 90-й перцентиль распределения на validation для взвешенного ансамбля — 0,602, округлено до 0,6 (рис. 5–6). Для равного ансамбля 90-й перцентиль 60,08%, также 0,6. Для одного HistGradientBoosting распределение смещено вправо; 90-й перцентиль 0,679, \(P_2 = 0,68\) (рис. 7).

Распределение вероятностей взвешенного ансамбля
Рис. 5. Гистограмма вероятностей взвешенного ансамбля (вес HistGradientBoosting удвоен).
Распределение вероятностей равного ансамбля
Рис. 6. Гистограмма вероятностей равновзвешенного ансамбля.
Распределение вероятностей HistGradientBoosting
Рис. 7. Гистограмма вероятностей только HistGradientBoosting.

3.6. Реализация и настройка

Все тесты — собственный бэктест. Equity curve строится от 1000 долларов с реинвестированием. Допущения: дробные акции; для short не требуется залог (zero cost arbitrage at inception). Если не указано иное — транзакционные издержки 0,05% при открытии и закрытии.

3.7. Оптимизации риск-менеджмента

3.7.1. Зависящие от времени функции take profit

Классификация качества сигнала основана на достижении фиксированного profit target. Экспериментальный подход снижает порог с каждым днём после открытия позиции:

\[ \mathrm{Threshold}_{tp} = \mathrm{THR} \cdot \frac{10 - TD}{10} \]

где \(TD\) — число дней с последнего ребаланса, \(\mathrm{THR}\) — масштабирующий фактор. Для согласованности с классификаторами \(\mathrm{THR} = 8\%\): ожидаемое значение \(\mathrm{Threshold}_{tp}\) за 9 дней равно порогу обучения (4%). Take profit учитывает только adjusted close в дни без ребаланса; реализованная прибыль может быть выше.

3.7.2. Функции stop loss

Stop loss предотвращает аномальные убытки при рыночных спадах. Аналогичная time-variant схема с масштабом 5% (другие значения — в анализе чувствительности):

\[ \mathrm{Threshold}_{sl} = 0{,}05 \cdot \frac{10 - TD}{10} \]

3.8. Решения с учётом вероятности

3.8.1. Позиции с весами Kelly

Применена упрощённая версия Kelly для каждой акции отдельно; доли масштабируются так, чтобы суммы long и short сигналов равнялись 1. При вероятности прибыльности \(P\), симметричных выигрышах/проигрышах с фактором \(\lambda\), капитал после \(n\) шагов:

\[ W_n = W_0 \cdot (1 - \lambda f)^L (1 + \lambda f)^W \]

Средняя геометрическая доходность \(R = (1-\lambda f)^{L/n}(1+\lambda f)^{W/n}\). Максимизация \(\log R\) при \(W/n = P\), \(L/n = 1-P\):

\[ \log R = (1-P)\log(1-\lambda f) + P\log(1+\lambda f) \] \[ \frac{dR}{df} = \frac{2P - 1 - \lambda f}{1 - (\lambda f)^2} = 0 \quad\Rightarrow\quad f = \frac{2P-1}{\lambda} \]

При масштабировании долей и равном \(\lambda\) для всех сигналов: \(f = 2P - 1\). Сравнивается с равновзвешенными позициями.

3.8.2. Risk-weighted stop/take profit

Вероятности классификатора умножают пороги take profit и stop loss — для более рискованных сигналов порог закрытия ниже:

\[ \mathrm{Threshold}_{RW} = \mathrm{Threshold} \cdot P \]

4. Эмпирические результаты

4.1. Производительность портфелей

Предложенное решение сравнивается с репликациями Cartea et al. (2023) с издержками и без, а также с ETF SPY как прокси рынка. Out-of-sample период: 03.2006–12.2022.

Таблица 8. Метрики предложенной стратегии и бенчмарков.
MetricStrategyBenchmarkBenchmark W/o tcSPY
ARC49,33%1,13%9,01%9,12%
ASD38,01%9,16%9,14%20,11%
IR*1,300,140,960,45
SORTINO3,380,291,770,70
MDD31,98%34,30%20,68%55,19%
MLD2,10 years2,59 years1,54 years4,85 years
CR1,540,040,440,17
IR**2,000,010,420,08

Strategy — предложенный подход (взвешенный ансамбль, модификации stop/take profit, Kelly). Benchmark — Cartea et al. с 0,05% издержками; Benchmark W/o tc — без издержек; SPY — ETF.

Стратегия характеризуется высокой доходностью и волатильностью, но рост ARC непропорционально выше роста ASD — IR* почти в 10 раз выше benchmark при тех же издержках. Sortino ещё выгоднее — downside volatility меньше общей. Одновременно drawdown ниже, чем у benchmark и SPY. Calmar и IR** существенно выше.

Для значимости проведён t-test IR* стратегии против SPY (\(\alpha = 0{,}01\), по Bieganowski & Ślepaczuk 2024):

\[ t = \frac{\mathrm{IR}^*_s - \mathrm{IR}^*_b}{\sigma / \sqrt{n}} \]
Таблица 9. t-test IR* стратегии против SPY.
IR*-StrategyIR*-SPYSEdftp-value
1,300,450,000442252118,84< 0,00001

H₀: IR* стратегии не больше IR* SPY — отвергается на уровне 1%.

Equity curves предложенной стратегии и бенчмарков
Рис. 8. Equity curves предложенной стратегии и бенчмарков (03.2006–12.2022).

Стратегия генерирует существенно более высокую доходность; темп роста замедлился около 2016 года. Причины: (1) базовая стратегия Cartea et al. тоже показывает спад в тот же период; (2) высокая доходность 2010–2016 связана с ограниченным числом очень прибыльных сделок — «ступенчатая» equity curve. Основной вклад — акция Emporium Petroleum (EP); реже — Ocean Thermal Energy Corp (CPWR). Обе входили в S&P 500, но с высокой волатильностью и низким/умеренным объёмом. Производительность без EP и CPWR проверена в анализе чувствительности. Это указывает на потенциал на более волатильных бумагах (Russell 2000 и т.п.), но и на риск зависимости от отдельных экстремальных движений.

5. Анализ чувствительности

5.1. Модификации stop/take profit и критерий Kelly

Base case сравнивается с flat base case with Kelly (без time-variant и probability-weighted модификаций stop/take profit) и flat base case (без Kelly).

Таблица 10. Чувствительность к stop/take profit и Kelly.
MetricBase caseFlat Base Case KellyFlat Base CaseSPY
ARC49,33%52,63%50,33%9,12%
ASD38,01%40,29%38,95%20,11%
IR*1,301,311,290,45
SORTINO3,383,253,260,70
MDD31,98%36,05%33,94%55,19%
MLD2,10 years2,82 years1,99 years4,85 years
CR1,541,461,480,17
IR**2,001,911,900,08

IR* различается не более чем на 2%. Kelly повышает доходность ценой волатильности и более длинного MLD. Time-variant и probability-weighted stop/take profit снижают доходность и волатильность примерно пропорционально, но улучшают MDD и downside risk — base case чуть лучше по Calmar, Sortino и IR**. Различия маргинальны; стратегия не чувствительна к удалению этих модификаций.

Equity curves анализа stop/take profit и Kelly
Рис. 9. Equity curves для анализа stop/take profit и Kelly.

5.2. Построение ансамбля

Табл. 11: веса base case оптимальны; альтернативные веса почти uniformly хуже, но обе альтернативы лучше SPY. Равный ансамбль — выше волатильность (рис. 10). Только HistGradientBoosting — относительно стабильная кривая, но просадка около 2017. Без округления порога — небольшое отличие от base case.

Таблица 11. Чувствительность к построению ансамбля.
MetricBase CaseHistGradientBoostingequally weightedW/t roundingSPY
ARC49,33%31,58%28,91%47,15%9,12%
ASD38,01%34,82%38,22%38,99%20,11%
IR*1,300,910,761,210,45
SORTINO3,381,891,543,110,70
MDD31,98%50,7%63,95%38,83%55,19%
MLD2,10 years3,01 years2,63 years3,22 years4,85 years
CR1,540,620,451,380,17
IR**2,000,560,341,670,08
Equity curves анализа весов ансамбля
Рис. 10. Equity curves для анализа весов ансамбля.

5.3. Транзакционные издержки

Base case устойчив к изменению ставки издержек: при росте costs производительность монотонно хуже, но при 0,1% всё ещё значительно лучше SPY (табл. 12, рис. 11).

Таблица 12. Чувствительность к ставке транзакционных издержек.
Metric0%Base Case0,075%0,1%SPY
ARC54,55%49,33%46,78%44,27%9,12%
ASD38,02%38,01%38,02%38,02%20,11%
IR*1,431,301,231,160,45
SORTINO3,743,383,203,030,70
MDD31,72%31,98%32,11%32,24%55,19%
MLD1,98 years2,10 years2,14 years2,17 years4,85 years
CR1,721,541,461,370,17
IR**2,462,001,801,590,08
Equity curves анализа транзакционных издержек
Рис. 11. Equity curves для анализа ставки транзакционных издержек.

5.4. Порог stop loss

Снижение и повышение порога stop loss умеренно ухудшают результат (табл. 13, рис. 12). Слишком низкий порог — преждевременное закрытие mean-reverting позиций; слишком высокий — недостаточное снижение downside risk. Стратегия умеренно чувствительна.

Таблица 13. Чувствительность к порогу stop loss.
Metric1%3%base case10%SPY
ARC41,54%41,93%49,33%46,00%9,12%
ASD35,29%35,75%38,01%39,12%20,11%
IR*1,181,171,301,180,45
SORTINO3,213,143,382,840,70
MDD32,08%28,58%31,98%41,05%55,19%
MLD3,01 years3,75 years2,10 years3,28 years4,85 years
CR1,301,521,541,120,17
IR**1,531,782,001,320,08
Equity curves анализа порога stop loss
Рис. 12. Equity curves для анализа порога stop loss.

5.5. Исключение сверхприбыльных акций

Исключение лучших акций резко снижает производительность (табл. 14, рис. 13) — base case в значительной степени капитализирует экстремальные движения цен. Тем не менее все варианты без EP/CPWR превосходят benchmark Cartea с издержками и SPY по Calmar, Sortino и information ratios — улучшение от классификаторов качества сигналов сохраняется. Высокая чувствительность к волатильным «драйверам» прибыли указывает и на риски масштабирования, и на возможности на более волатильных рынках.

Таблица 14. Чувствительность к исключению сверхприбыльных акций.
MetricBase caseBenchmarkW/o EP & CPWRW/o EPW/o CPWRSPY
ARC49,33%1,13%10,73%17,78%26,65%9,12%
ASD38,01%9,16%19,71%22,72%33,38%20,11%
IR*1,300,140,540,780,800,45
SORTINO3,380,290,832,091,570,70
MDD31,98%34,30%51,44%24,95%50,51%55,19%
MLD2,10 years2,59 years9,38 years1,67 years2,10 years4,85 years
CR1,540,040,210,710,530,17
IR**2,000,010,110,550,420,08
Equity curves исключения сверхприбыльных акций
Рис. 13. Equity curves при исключении EP и CPWR. До конца 2010 вариант без обеих акций опережал остальные и был устойчивее к кризисам 2008 и 2020.

5.6. Порог take profit

Удвоение и halving масштабирующего фактора take profit меняет IR* и Sortino менее чем на 10%; при факторе 0,16 MDD растёт ~50% (табл. 15, рис. 14). Стратегия не очень чувствительна к этому параметру.

Таблица 15. Чувствительность к масштабирующему фактору take profit.
MetricBase CaseBenchmark0,040,16SPY
ARC49,33%1,13%45,99%49,86%9,12%
ASD38,01%9,16%36,91%39,46%20,11%
IR*1,300,141,241,260,45
SORTINO3,380,293,323,100,70
MDD31,98%34,30%31,75%48,43%55,19%
MLD2,10 years2,59 years3,72 years3,37 years4,85 years
CR1,540,041,451,020,17
IR**2,000,011,801,230,08
Equity curves анализа take profit
Рис. 14. Equity curves для анализа масштабирующего фактора take profit.

5.7. Порог при построении in-sample датасета

Изменение порога \(T\) при labeling in-sample данных существенно влияет на результат (табл. 16, рис. 15): IR* падает, MDD более чем удваивается при \(T = 0{,}08\). Стратегия чувствительна к этому параметру.

Таблица 16. Чувствительность к порогу in-sample датасета.
MetricBase CaseBenchmark0,020,08SPY
ARC49,33%1,13%34,47%30,57%9,12%
ASD38,01%9,16%37,88%43,33%20,11%
IR*1,300,140,910,710,45
SORTINO3,380,292,051,320,70
MDD31,98%34,30%45,70%68,40%55,19%
MLD2,10 years3,56 years3,72 years2,92 years4,85 years
CR1,540,040,750,450,17
IR**2,000,010,680,320,08
Equity curves анализа in-sample порога
Рис. 15. Equity curves для анализа порога in-sample датасета.

5.8. Частота ребаланса и длина lookback окна кластеризации

Для проверки допущений раздела 3.3 исследована чувствительность к частоте ребаланса и числу дней для корреляционной матрицы (SPONGEsym). Обозначение \(a\&b\): \(a\) — частота ребаланса, \(b\) — длина lookback. При \(a \neq 10\) порог in-sample масштабирован линейно на \(a/10\).

Таблица 17. Чувствительность к частоте ребаланса и lookback.
MetricBase CaseBenchmark3&510&515&3010&45SPY
ARC49,33%1,13%−100%16,78%9,54%37,34%9,12%
ASD38,01%9,16%35,11%33,48%46,83%59,92%20,11%
IR*1,300,14−2,850,500,200,620,45
SORTINO3,380,29−3,180,940,951,420,70
MDD31,98%34,30%100%54,02%37,67%67,02%55,19%
MLD2,10 yrs.3,56 yrs.11,17 yrs.2,92 yrs.4,99 yrs.4,79 yrs.4,85 yrs.
CR1,540,04−10,310,250,580,17
IR**2,000,01−2,850,160,050,350,08

Base case: \(a=10\), \(b=30\). Стратегия очень чувствительна к обоим параметрам; изменение в любую сторону ухудшает результат. Частота ребаланса влияет сильнее; уменьшение обоих параметров сильнее бьёт по IR*, IR**, CR и Sortino. Возможная причина — признаки «средняя доходность кластера/акции за 10 дней» не оптимальны для других частот (особенно ребаланс каждые 3 дня). При других \(a,b\) нужно переопределять признаки. Стратегия 3&5 привела к банкротству портфеля — классификаторы, вероятно, учат шум (рис. 16).

Equity curves анализа ребаланса и lookback
Рис. 16. Equity curves для анализа частоты ребаланса и длины lookback окна кластеризации.

5.9. Сводка анализа чувствительности

Табл. 18 — число метрик, по которым данный вариант был лучшим в соответствующем блоке анализа. Base case лидирует по большинству параметров — подход существенно чувствителен к настройке.

Таблица 18. Сводка анализа чувствительности (число «лучших» метрик из 8).
ПараметрВарианты (число лучших метрик)
Stop loss / take profit / KellyNo time-variant, no Kelly: 1; No time variant, Kelly: 2; Time variant & Kelly (Base Case): 5
Ensemble weightsEqually Weighted: 0; HGB weight doubled (Base Case): 7; Only HistGradientBoosting: 1
Transaction costs0%: 7; 0,05% (Base Case): 1; 0,075%: 0; 0,1%: 0
Rebalance & lookback3&5: 0; 10&5: 0; 10&30 (Base Case): 7; 10&45: 0; 15&30: 1
Take profit threshold0,04: 2; 0,08 (Base Case): 5; 0,16: 1
In-sample threshold0,02: 1; 0,04 (Base Case): 7; 0,08: 0
Stop loss threshold1%: 1; 3%: 1; 5% (Base Case): 6; 10%: 0
Overperforming stocksWith EP & CPWR (Base Case): 5; Without EP & CPWR: 1; Without EP: 2; Without CPWR: 0

6. Выводы и дальнейшие исследования

Исследована алгоритмическая стратегия, в которой ансамбль ML-классификаторов фильтрует сигналы стат-арбитражного фреймворка на graph clustering. Данные — исторические составляющие S&P 500 (Yahoo Finance). Стратегия Cartea et al. (2023) модифицирована снижением частоты торгов. In-sample датасет из первых 1500 торговых дней содержит сигналы и их исходы. Train/validation split; обучены и настроены MLP, HistGradientBoosting, AdaBoost, логистическая регрессия и SGD (Brier и precision на validation). Out-of-sample тест с фильтрацией сигналов. Добавлены Kelly, time-variant stop loss/take profit и likelihood-weighted позиции. Все варианты с классификаторами превзошли исходную graph clustering стратегию и buy-and-hold SPY при реалистичных транзакционных издержках.

Ответы на исследовательские вопросы:

Ограничения: качество данных Yahoo Finance не идеально; пропуски увеличивают неопределённость бэктеста. Slippage не учитывался — либeralное допущение при значительной прибыли от волатильных акций. Precision и Brier на validation невысоки — вероятно из-за неоптимального feature engineering и отсутствия отбора признаков.

Направления дальнейших исследований: тест на крипторынке и других высоковолатильных средах; multilabel классификация (profitable long / profitable short / unprofitable); более высокие частоты данных, типичные для stat arb.

Литература

Оригинал статьи: Korniejczuk and Ślepaczuk, «Statistical arbitrage in multi-pair trading strategy based on graph clustering algorithms in US equities market», arXiv:2406.10695