Применение процесса Орнштейна — Уленбека к парному трейдингу
Джират Сучато, Шон Вирьяди, Даньжань Чэнь, Ава Чжао, Майкл Юэ · Колумбийский университет · 17 декабря 2024
Оригинал: Suchato, J., Wiryadi, S., Chen, D., Zhao, A., Yue, M. «An Application of the Ornstein-Uhlenbeck Process to Pairs Trading», 2024 — arxiv.org/abs/2412.12458 (PDF).
Рисунки воспроизведены из оригинальной публикации. Оригинал размещён под CC0 1.0 — передан в общественное достояние, ограничений на использование и переработку нет.
Оговорка авторов. Результаты этой работы предварительны и предназначены исключительно для образовательных целей. Работа написана в рамках учебного курса «Методы, основанные на данных, в финансах», преподаваемого в Колумбийском университете. Содержание работы не является финансовым советом. Авторы снимают с себя всякую ответственность за финансовые потери или иные последствия, связанные с использованием этой работы.
Аннотация
В работе проводится предварительный анализ стратегии парного трейдинга, использующей процесс Орнштейна — Уленбека для моделирования разностей цен акций, и её сравнение с наивной стратегией парного трейдинга, где среднее и стандартное отклонение вычисляются по скользящему окну. Наши предварительные результаты позволяют предположить, что стратегия с процессом Орнштейна — Уленбека превосходит наивную по соотношению риска и доходности. Ключевые направления дальнейших исследований — отбор пар, расширение инвестиционной вселенной, поиск иных критериев отбора пар, применение более строгих методов машинного обучения для прогноза ценовых трендов и интеграция методов портфельной оптимизации.
Введение
Парный трейдинг — широко используемая рыночно-нейтральная стратегия количественных финансов, использующая схождение цен двух исторически коррелированных бумаг. Одновременно продавая переоценённый актив и покупая недооценённый, стратегия стремится извлечь прибыль из склонности их ценового спреда возвращаться к среднему. В отличие от направленных стратегий, парный трейдинг не зависит от общего направления рынка, что делает его устойчивым в волатильных или застойных условиях.
Этот проект стремится улучшить традиционный каркас парного трейдинга за счёт статистических и эконометрических методов. В частности, мы исследуем применение тестов коинтеграции и моделирование спреда как процесса с возвратом к среднему при помощи модели Орнштейна — Уленбека (ОУ). Методология проверяется на исторических рыночных данных для оценки результативности и устойчивости в различных рыночных условиях.
Отбор пар критичен. Выбираемые пары должны демонстрировать высокую корреляцию между процентными изменениями цен каждой бумаги, а ценовой спред должен проявлять возврат к среднему. После отбора пар можно разработать алгоритм, моделирующий спред и прогнозирующий будущие ценовые тренды, чтобы занять направленную позицию по спреду. В нашем случае для этого используется процесс Орнштейна — Уленбека, а результаты сравниваются с базовым расчётом Z-оценки по скользящим среднему и стандартному отклонению — путём тестирования на исторических ценовых данных.
Данные
Вселенная анализируемых акций определена как все компании США с рыночной капитализацией более 1 млрд долларов. Данные по акциям получены из Refinitiv Datastream, конкретно из таблицы wrds ds2dsf, дающей такие финансовые показатели, как рыночная капитализация, доходности и цены. Набор ограничен компаниями, зарегистрированными в США и торгуемыми в долларах, с данными начиная с 2018 года. Это позволило сосредоточиться на ликвидных акциях крупной капитализации.
Дополнительно извлечены метаданные из таблицы wrds ds names, включающей ключевые идентификаторы: названия компаний, тикеры и прочие сведения о бумагах. После получения данных удалены дубликаты по сочетанию infocode и dscode, чтобы каждая бумага была представлена единожды.
Далее отфильтрованные данные по акциям объединены с метаданными внутренним соединением по обоим идентификаторам, так что сохранены только бумаги, присутствующие в обоих наборах. Ещё одно объединение добавило общие отраслевые описания и описания отраслевых групп. Итоговый набор содержит 3 986 371 строку и 26 столбцов. После объединения отобрано подмножество релевантных столбцов: идентификаторы infocode, dscode, тикер, ISIN, а также финансовые показатели — капитализация, доходности, цены закрытия — и отраслевые описания. Пример данных приведён в таблицах 1 и 2.
Отбор пар
Для количественной оценки сходства доходностей двух компаний вычислялось среднеквадратичное расстояние (MSD) для каждой пары. Расчёт выполнялся только на данных 2018–2020 годов, чтобы обеспечить анализ на момент времени; сама стратегия анализировалась на периоде после 2018–2020 годов. Среднеквадратичное расстояние между компаниями $i$ и $j$ по их доходностям:
$$d_{ij} = \frac{1}{N}\sum_{t=1}^{N}\left(R_{i,t} - R_{j,t}\right)^2 \tag{1}$$
где $R_{i,t}$ и $R_{j,t}$ — доходности компаний $i$ и $j$ в момент $t$.
Отбирались пары с наименьшими значениями MSD, поскольку предполагается, что они демонстрируют наибольшее сходство доходностей. Ради независимости и во избежание избыточности компания, попавшая в одну пару, исключалась из дальнейших сопоставлений. Это дало список уникальных пар с минимальными отклонениями доходностей — сильных кандидатов для дальнейшей проверки.
Проверка пар
После отбора по расстоянию статистическая связь между доходностями каждой пары проверялась тестом коинтеграции Энгла — Грейнджера. Тест выполнялся регрессией методом наименьших квадратов доходностей одной компании на другую с последующим анализом остатков на стационарность. Тест давал статистику коинтеграции и соответствующее $p$-значение, где значение ниже 0,05 указывало на статистически значимую долгосрочную равновесную связь между двумя рядами. Пары, прошедшие тест, сохранялись как валидные торговые кандидаты, поскольку их доходности демонстрировали возврат к среднему — свойство, критичное для парных стратегий.
Наконец, проводился ручной просмотр пар с оценкой характеристик компаний — отрасли и отношений с поставщиками. По его итогам пары делились на три группы: отличные, средние и плохие. Этот трёхшаговый процесс — ранжирование по расстоянию, тест коинтеграции и ручная оценка — обеспечил, что итоговые пары не только имеют схожие профили доходности, но и демонстрируют стабильные долгосрочные связи.
Например, пара United Airlines и Delta Airlines дала статистику коинтеграции $-12{,}0389$ при $p$-значении 0,000, что указывает на статистически значимую связь, пригодную для торговли. Напротив, пара Credit Corp LTD и Farmers & Merchants Bank дала статистику $-0{,}252617$ при $p$-значении 0,9779, что говорит об отсутствии значимой коинтеграции и, следовательно, о непригодности для дальнейшего анализа.
Торговая стратегия
Базовая стратегия
Базовая модель — наивный алгоритм парного трейдинга, вычисляющий скользящие среднее и стандартное отклонение спреда за 30-дневный период:
$$\mu_{ij} = \frac{1}{30}\sum_{t=-30}^{0} S_{ijt} \tag{2}$$
$$\sigma_{ij} = \sqrt{\frac{\left(S_{ij} - \mu_{ij}\right)^2}{30 - 1}} \tag{3}$$
Эта модель служит базовой линией: вычисление Z-оценки по скользящим среднему и стандартному отклонению — обычная практика для стандартной стратегии парного трейдинга.
Встраивание модели ОУ
Стратегия начинается с вычисления ценового спреда между двумя активами. Для каждого периода $t$ спред между акциями $i$ и $j$:
$$S_{ijt} = P_{it} - P_{jt} \tag{4}$$
Предполагается, что этот спред следует процессу Орнштейна — Уленбека, улавливающему возврат к среднему. Процесс задаётся стохастическим дифференциальным уравнением
$$dS_t = \lambda\left(\mu - S_t\right)dt + \sigma\, dW_t \tag{6}$$
которое дискретизируется как
$$S_{t+1} = S_t e^{-\lambda\delta} + \mu\left(1 - e^{-\lambda\delta}\right) + \sigma\sqrt{\frac{1 - e^{-2\lambda\delta}}{2\lambda}}\, \mathcal{N}_{0,1} \tag{7}$$
Дискретная форма записывается в виде линейной регрессии
$$S_{t+1} = a S_t + b + \epsilon \tag{8}$$
где
$$a = e^{-\lambda\delta}, \qquad b = \mu\left(1 - e^{-\lambda\delta}\right), \qquad \operatorname{sd}(\epsilon) = \sigma\sqrt{\frac{1 - e^{-2\lambda\delta}}{2\lambda}} \tag{9}$$
Решая относительно параметров модели ОУ, получаем
$$\lambda = -\frac{\ln a}{\delta}, \qquad \mu = \frac{b}{1 - a}, \qquad \sigma = \operatorname{sd}(\epsilon)\sqrt{\frac{-2\ln a}{\delta\left(1 - a^2\right)}} \tag{10}$$
Таким образом, мы запускаем авторегрессионную модель (8), получая $a_{ij}$ и $b_{ij}$ для каждой пары, а затем по (10) оцениваем параметры $\mu_{ij}$, $\lambda_{ij}$, $\sigma_{ij}$. Эти параметры позволяют вычислить Z-оценки, стандартизующие отклонения спреда от его среднего:
$$Z = \frac{S_t - \mu}{\sigma} \tag{11}$$
Генерация сигналов
Z-оценка ценового спреда определяет торговые сигналы:
- Открыть короткую позицию: если $Z$ выше верхнего порога — продать спред (продать опережающий актив, купить отстающий).
- Открыть длинную позицию: если $Z$ ниже нижнего порога — купить спред (купить отстающий актив, продать опережающий).
- Закрыть позицию: если $Z$ возвращается в пределы порогов выхода или приближается к нулю.
В обеих стратегиях вычисленная Z-оценка отображалась в перцентиль. Перцентиль рассчитывался скользящим образом с окном ретроспективы в 90 дней, на момент времени. Если Z-оценка оказывалась выше 75-го перцентиля, на следующий день открывалась короткая позиция по спреду; если ниже 25-го — длинная. При пересечении 50-го перцентиля позиция закрывалась. Результативность измерялась на тестовых данных; для стратегии с моделью ОУ авторегрессия обучалась на обучающих данных, а результат измерялся на тестовых.
Результаты
Мы обнаруживаем, что стандартный портфель имеет ожидаемую доходность 7,21% при коэффициенте Шарпа 0,778. Портфель, использующий процесс Орнштейна — Уленбека, имеет ожидаемую доходность 4,92% при коэффициенте Шарпа 0,468. Обе стратегии показали положительную доходность.
Изучение корреляционных матриц обеих стратегий показывает очень слабую межпарную корреляцию, что говорит о разумной диверсификации и ортогональности доходностей друг другу.
Стандартная стратегия давала положительную дневную доходность в 54,63% случаев, а стратегия с ОУ — в 53,3%. Хотя это сильное соотношение выигрышей и проигрышей, требуется дальнейшая работа по проверке устойчивости стратегий на вневыборочных данных.
Хотя модель ОУ отработала хуже стандартной, график накопленной доходности указывает, что модель улавливает верные сигналы и общий тренд. Это позволяет предположить, что модель обладает сильной предсказательной способностью, но проиграла из-за таких факторов, как неоптимальная настройка параметров или неподходящий порог Z-оценки. Мы полагаем, что причина, вероятно, в потенциальной нестационарности некоторых пар, приведшей к слабому возврату к среднему. Для смягчения этого можно было бы применить расширенный тест Дики — Фуллера для проверки стационарности пар, что придало бы больше надёжности расчёту Z-оценки, поскольку среднее и стандартное отклонение постоянны.
Тем не менее для подтверждения устойчивости и валидности результатов нужны дальнейшие проверки на дополнительных вневыборочных данных. Кроме того, тест коинтеграции проводился на периоде 2018–2020 годов, то есть до кризиса COVID-19. Смена режима могла изменить поведение спреда после пандемии, и стоит исследовать, насколько сильно ценовые корреляции были затронуты крупными рыночными режимами и событиями.
Заключение
Наши результаты позволяют предположить, что парный трейдинг с процессом Орнштейна — Уленбека уступил наивному алгоритму. Отставание, вероятно, обусловлено ограниченной предсказательной силой модели и тем, что мы обобщаем результаты на все компании сразу. В дальнейшей работе можно рассмотреть обусловливание стратегии по отраслям и тонкую настройку параметров при оценивании модели ОУ.
Обсуждение
Дальнейшая работа должна также исследовать иные статистические методологии отбора пар. Наши пары выбирались по наименьшему среднеквадратичному расстоянию между процентными изменениями цен. Стоит изучить другие метрики или их сочетания: процентную абсолютную разность, расстояние на основе корреляции, косинусное сходство. Тестирование одного и того же алгоритма с фиксированными параметрами при варьировании метрик отбора помогло бы оценить эффективность каждой метрики. Дополнительные тесты автокорреляции могли бы ещё уточнить отбор.
Полезной была бы и работа по портфельной оптимизации ради нейтральности к факторам и секторам. Это можно сделать, взяв дополнительные ряды доходностей различных факторов или секторов, выполнив многомерную регрессию или метод главных компонент (чтобы дополнительно устранить мультиколлинеарность между факторами) для нахождения бет, и решив задачу квадратичного программирования для оптимизации веса каждого спреда в портфеле при соблюдении ограничений факторной и секторной нейтральности.
Наконец, следует исследовать настройку гиперпараметров: пороги Z-оценки, заданные сейчас произвольно на уровне 25-го и 75-го перцентилей, следует уточнить с учётом различий результативности между отраслями.
Ограничения
Симуляция не учитывала транзакционные издержки, и при реальной реализации доходности могли бы оказаться ещё ниже. Проскальзывание также не учитывалось. Мы предполагаем, что сделки совершаются на следующий день и что их размер пренебрежимо мал и не двигает рынок. Стратегия опирается также на допущение, что все отобранные пары демонстрируют возврат к среднему, — в действительности это допущение может не выполняться, а нестационарные пары приведут к слабым результатам, если схождения не произойдёт. Наконец, стратегия тестировалась на ограниченном годичном интервале, который может не полностью охватывать эффекты различных экономических условий — подъёмов, рецессий, смены руководства или глобальных событий вроде пандемий.
Приложение
| infocode | dscode | isin | тикер | название | регион | дата |
|---|---|---|---|---|---|---|
| 6347.0 | 151928 | US84265V1052 | SCCO | SOUTHERN COPPER | US | 2018-01-02 |
| 6347.0 | 151928 | US84265V1052 | SCCO | SOUTHERN COPPER | US | 2018-01-03 |
| 6347.0 | 151928 | US84265V1052 | SCCO | SOUTHERN COPPER | US | 2018-01-04 |
| 6347.0 | 151928 | US84265V1052 | SCCO | SOUTHERN COPPER | US | 2018-01-05 |
| 6347.0 | 151928 | US84265V1052 | SCCO | SOUTHERN COPPER | US | 2018-01-08 |
| дата | скорректированная цена закрытия | общая отрасль | отраслевая группа |
|---|---|---|---|
| 2018-01-02 | 48,127152 | INDUSTRIAL | COPPER PRODUCERS |
| 2018-01-03 | 48,215742 | INDUSTRIAL | COPPER PRODUCERS |
| 2018-01-04 | 47,969693 | INDUSTRIAL | COPPER PRODUCERS |
| 2018-01-05 | 48,343677 | INDUSTRIAL | COPPER PRODUCERS |
| 2018-01-08 | 48,570053 | INDUSTRIAL | COPPER PRODUCERS |
| Метрика | Значение |
|---|---|
| Ожидаемая доходность (годовая) | 0,072177 |
| Волатильность (годовая) | 0,079848 |
| Коэффициент Шарпа | 0,778685 |
| Коэффициент Сортино | 1,202846 |
| Максимальная просадка | −0,059133 |
| VaR (95%) | −0,008078 |
| Доля выигрышных дней | 0,546358 |
| Метрика | Значение |
|---|---|
| Ожидаемая доходность (годовая) | 0,049272 |
| Волатильность (годовая) | 0,083920 |
| Коэффициент Шарпа | 0,467963 |
| Коэффициент Сортино | 0,773067 |
| Максимальная просадка | −0,089884 |
| VaR (95%) | −0,008473 |
| Доля выигрышных дней | 0,533113 |
Рисунок 1 — смотреть в оригинале (PDF)
Рисунок 2 — смотреть в оригинале (PDF)
Рисунок 3 — смотреть в оригинале (PDF)
Рисунок 4 — смотреть в оригинале (PDF)
Рисунок 5 — смотреть в оригинале (PDF)
Рисунок 6 — смотреть в оригинале (PDF)
Рисунок 7 — смотреть в оригинале (PDF)
Рисунок 8 — смотреть в оригинале (PDF)
Рисунок 9 — смотреть в оригинале (PDF)
Рисунок 10 — смотреть в оригинале (PDF)
Литература
- H. Geman, L. Chang, B. Liu, Intraday pair trading strategies on high-frequency data: the case of oil companies, Quantitative Finance 17(1) (2016) 87–100.
- R. Liu, J. Tie, Z. Wu, Q. Zhang, Pairs trading: an optimal selling rule with constraints, arXiv:2307.15300.
- J. L. McCauley, G. H. Gunaratne, K. E. Bassler, Calibrating the Ornstein-Uhlenbeck model for financial time series.
- G. Vidyamurthy, The profitability of pairs trading strategies: distance, cointegration and control.
Оригинал статьи: Suchato, J., Wiryadi, S., Chen, D., Zhao, A., Yue, M., «An Application of the Ornstein-Uhlenbeck Process to Pairs Trading», arXiv:2412.12458 · лицензия CC0 1.0