Глубокое обучение с подкреплением для активной высокочастотной торговли

8/10

Антонио Бриола, Джереми Туриэль, Риккардо Маркаччоли, Альваро Кодеран, Томазо Асте · Университетский колледж Лондона; Кафедра эконофизики и сложных систем, École Polytechnique; Центр системного риска, Лондонская школа экономики; ETH Цюрих · v3, 19 августа 2023 (первая версия — 18 января 2021)

Оригинал: Briola, A., Turiel, J., Marcaccioli, R., Cauderan, A., Aste, T. «Deep Reinforcement Learning for Active High Frequency Trading», 2021 — arxiv.org/abs/2101.07107 (PDF).

Код: FinancialComputingUCL/DRL_for_Active_High_Frequency_Trading

Рисунки воспроизведены из оригинальной публикации. Оригинал распространяется по лицензии CC BY-NC-SA 4.0, которая допускает переработку при некоммерческом использовании и распространении на тех же условиях; все права на оригинальный текст принадлежат авторам.

Ключевые слова: искусственный интеллект, глубокое обучение с подкреплением, высокочастотная торговля, микроструктура рынка.

Аннотация

Мы представляем первый сквозной фреймворк на основе глубокого обучения с подкреплением (DRL) для активной высокочастотной торговли на фондовом рынке. Мы обучаем DRL-агентов торговать одной единицей акции Intel Corporation, применяя алгоритм проксимальной оптимизации политики. Обучение проводится на трёх смежных месяцах высокочастотных данных лимитного стакана, из которых последний месяц служит валидационными данными. Чтобы максимизировать отношение сигнала к шуму в обучающих данных, мы формируем их, отбирая только образцы с наибольшими изменениями цены. Тест затем проводится на следующем месяце данных. Гиперпараметры настраиваются методом последовательной оптимизации на основе модели.

Мы рассматриваем три различные характеризации состояния, различающиеся мета-признаками на основе стакана. Анализируя результаты агентов на тестовых данных, мы утверждаем, что агенты способны создавать динамическое представление лежащей в основе среды. Они выявляют случающиеся закономерности в данных и используют их для построения долгосрочно прибыльных торговых стратегий. Агенты выучивают стратегии, дающие стабильно положительную доходность несмотря на крайне стохастическую и нестационарную среду.

1. Введение

Могут ли машины научиться торговать автоматически? Какие данные им для этого нужны? Если это удаётся, можем ли мы узнать через них что-то о механизме формирования цены? В этой работе мы пытаемся ответить на такие вопросы средствами глубокого обучения с подкреплением.

За последние десять лет алгоритмы DRL применялись к самым разным областям — от робототехники до здравоохранения. Финансовые рынки известны как стохастические среды с очень низким отношением сигнала к шуму, где доминирует выраженно нестационарная динамика и присутствуют сильные петли обратной связи и нелинейные эффекты. Это особенно верно для данных наивысшей детализации, то есть на уровне микроструктуры.

Лимитный стакан — площадка, где участники рынка выражают намерение купить или продать определённый объём бумаги на определённом ценовом уровне, подавая заявки по этой цене. Интерес к применению DRL в таком контексте несомненно велик. Во-первых, все алгоритмы, использующие мощь искусственных нейросетей, известны своей прожорливостью к данным, а благодаря распространению электронной торговли всё происходящее в стакане может быть записано с наносекундным разрешением. Во-вторых, на таких данных можно определить несколько разных задач, потенциально решаемых обучением с подкреплением.

Есть ряд исследовательских вопросов с непосредственным практическим интересом. Может ли агент научиться распределять заданный капитал между набором активов? Если нужно купить или продать большой объём, можно ли обучить агента делать это оптимально? Можно ли обучить агента напрямую выучивать торговые стратегии на разных частотах и для разного числа активов?

В настоящей работе мы беремся за последнюю задачу. Мы показываем, как можно обучить DRL-агентов на данных стакана покупать и продавать единичные единицы актива и достигать долгосрочной прибыли. Мы выбираем торговлю единственной единицей потому, что наша цель — не максимизировать виртуальную прибыль агента, а представить первый сквозной фреймворк для успешного развёртывания алгоритмов DRL в активной высокочастотной торговле. Мы применяем алгоритм проксимальной оптимизации политики (PPO), принимаем парадигму непрерывного обучения и настраиваем гиперпараметры методом последовательной оптимизации на основе модели.

Мы используем простейший объект политики из библиотеки Stable Baselines, реализующий схему «актор — критик» через многослойный перцептрон. Наконец, чтобы упорядочить динамику функции прибыли и убытка, мы строим обучающую выборку особой стратегией сэмплирования, отбирающей периоды высокой ценовой активности, которые часто характеризуются более высоким отношением сигнала к шуму. Это даёт агенту более информативную обучающую выборку.

2. Предварительные сведения

2.1. Лимитный стакан

Сегодня для организации торговли большинство бирж применяют электронный механизм — лимитный стакан. Формирование цены актива в стакане есть самоорганизующийся процесс, движимый подачей и снятием заявок. Заявки можно мыслить как видимые декларации намерения участника купить или продать определённое количество актива по определённой цене. Заявки помещаются в очередь, пока не будут сняты владельцем либо исполнены против заявки противоположного направления. Исполнение пары заявок означает, что их владельцы торгуют согласованное количество по согласованной цене. Исполнение следует механизму «первым пришёл — первым обслужен».

Заявка $x$ определяется четырьмя атрибутами: знаком или направлением $\epsilon_x$ (покупка или продажа), ценой $p_x$, числом акций (объёмом) $V_x$ и временем подачи $\tau_x$, то есть кортежем $x = (\epsilon_x, p_x, V_x, \tau_x)$. Когда трейдер подаёт заявку на покупку (продажу), автоматический алгоритм сопоставления проверяет возможность исполнить её против одной или нескольких существующих заявок противоположного знака с ценой не выше (не ниже) $p_x$. По соглашению заявки на продажу имеют отрицательный знак $\epsilon = -1$, на покупку — положительный $\epsilon = +1$. Любое частичное сопоставление объёма происходит немедленно, а несопоставленная часть становится активной по цене $p_x$ и остаётся таковой до сопоставления или снятия.

Рисунок 1
Рисунок 1. Графическая иллюстрация лимитного стакана, его компонент, связанных величин и динамики: сторона покупки и продажи, лучшие цены, средняя цена, спред, глубина рынка, приходящая лимитная заявка на покупку и приходящая рыночная заявка.

Совокупность всех активных лимитных заявок на продажу образует сторону ask, а всех заявок на покупку — сторону bid. Разность цен $\sigma_\tau = p^{\text{best}}_{a,\tau} - p^{\text{best}}_{b,\tau}$ между лучшими заявками на продажу и покупку определяет спред, а среднее лучших цен называется средней ценой: $m_\tau = \left(p^{\text{best}}_{a,\tau} + p^{\text{best}}_{b,\tau}\right)/2$.

Заявки, исполняемые по лучшей цене покупки или продажи, называются рыночными. Они получают приоритет по времени, поскольку исполняются немедленно, но ценой доплаты за каждую единицу актива в размере не менее спреда. Именно поэтому спред называют стоимостью рыночной заявки. Заявки, не исполненные полностью при поступлении, называются лимитными. Наиболее распространённый механизм приоритета, действующий и в рассматриваемом здесь стакане, — «цена — время»: среди заявок по одной цене первой исполняется поданная раньше.

Параметр времени $\tau$ естественно непрерывен, однако когда требуется охарактеризовать эффект некоторого события на стакан (например, среднее движение цены после рыночной заявки), удобнее нормировать время и работать в тиковом времени, где время эволюционирует как дискретная переменная, обновляемая при каждом записанном событии стакана.

2.2. Алгоритм проксимальной оптимизации политики

Обучение с подкреплением можно описать как задачу, стоящую перед обучающимся, который пытается достичь конкретной цели, минимизируя связанные издержки, через взаимодействие с динамической средой методом проб и ошибок. В ходе обучения агент испытывает различные состояния и совершает разнообразные действия. Эффект конкретной пары «состояние — действие» оценивается функцией счёта и числовым вознаграждением. Агенту нужно найти оптимальный баланс между использованием уже испытанных пар и исследованием невиданных.

Это соответствует нахождению оптимального отображения (политики $\pi$) между множеством состояний $S$ и распределением вероятностей на множестве действий $A$, максимизирующего дисконтированное накопленное вознаграждение во времени.

Будучи эффективными для широкого круга задач в базовой конфигурации, алгоритмы RL страдают от проклятия размерности: чем больше признаков описывает состояние агента, тем труднее выучить оптимальную стратегию, поскольку искать её приходится в пространстве, размер которого растёт комбинаторно. Чтобы масштабировать классические алгоритмы на задачи высокой размерности, было введено глубокое обучение с подкреплением: использование нейросетей для автоматического получения представлений меньшей размерности позволяет преодолеть проклятие размерности. Тем не менее алгоритмы DRL могут требовать больших объёмов данных, а обучение общеизвестно трудно.

Среди прочих проблем — высокая чувствительность к настройке гиперпараметров и инициализации. Например, неверная скорость обучения может загнать сеть политики в область пространства параметров, где следующая порция данных будет собрана при очень плохой политике, из-за чего восстановление станет невозможным. Для преодоления этого введён алгоритм PPO. Он известен как масштабируемый, эффективный по данным и устойчивый, а также один из наиболее подходящих для крайне стохастических областей.

PPO принадлежит семейству методов градиента политики, преимущественно on-policy. Они используют функцию потерь политики

$$L^{PG}(\theta) = \mathbb{E}_t\left[\log \pi_\theta(a_t \mid s_t)\right]\hat{A}_t \tag{1}$$

где $\mathbb{E}_t[\log \pi_\theta(a_t \mid s_t)]$ — ожидаемый логарифм вероятности выполнения действия $a$ в состоянии $s$, а оценка функции преимущества $\hat{A}_t$ даёт оценку ценности текущего действия по сравнению со средним по всем прочим возможным действиям в состоянии $s$.

Методы PPO обеспечивают устойчивость обновления политики, напрямую контролируя размер шага градиентного подъёма. Для этого целевая функция записывается как

$$L^{CPI}(\theta) = \mathbb{E}_t\left[\frac{\pi_\theta(a_t \mid s_t)}{\pi_{\theta_{old}}(a_t \mid s_t)}\hat{A}_t\right] = \mathbb{E}_t\left[r_t(\theta)\hat{A}_t\right] \tag{2}$$

где логарифм заменён отношением вероятности действия при текущей политике к вероятности при предыдущей. Если $r_t(\theta) > 1$, действие вероятнее в текущей политике, чем в прежней; если $0 < r_t(\theta) < 1$ — наоборот. Заметим, что при отклонении $r_t(\theta)$ от единицы выполнялось бы чрезмерно большое обновление политики. Чтобы этого избежать, целевая функция модифицируется так, чтобы штрафовать значения $r_t(\theta)$ вне интервала $[1-\epsilon, 1+\epsilon]$:

$$L^{CLIP}(\theta) = \mathbb{E}_t\left[\min\left(r_t(\theta)\hat{A}_t,\ \operatorname{clip}\left(r_t(\theta),\ 1-\epsilon,\ 1+\epsilon\right)\hat{A}_t\right)\right] \tag{3}$$

Здесь, как и в исходной работе, взято $\epsilon = 0{,}2$.

3. Связанные работы

Чжан и соавторы представили две работы по прогнозу доходностей средней цены. Первая напрямую прогнозирует доходности на микроструктурном уровне байесовскими сетями, вторая разрабатывает архитектуру глубокого обучения для одновременного моделирования квантилей доходности длинных и коротких позиций. Последняя вводит нынешнюю передовую архитектуру, сочетающую свёрточные сети и LSTM. Недавний обзор всех упомянутых методов подчёркивает, что моделирование стакана через его временно́е и пространственное измерения даёт хорошее приближение, но не необходимое и не оптимальное. Эти выводы оправдывают использование в настоящей работе многослойного перцептрона в качестве сети политики для DRL-агента.

Применения RL к данным финансовых рынков восходят к началу 2000-х. Обычно они касались низкочастотной торговли одним активом или индексом, распределения портфеля, вплоть до ранних форм внутридневной торговли. Недавний всплеск интереса к DRL естественно привёл исследователей к применению этих алгоритмов к рыночным данным или симуляциям. Что касается торговых приложений, исследователи в основном рассматривали активную торговлю отдельными активами на смоделированных или реальных данных в низкочастотной (обычно дневной) области. Другие работы сосредоточились на распределении между несколькими активами или на управлении портфелем в целом.

Корпус литературы по применению DRL в высокочастотной области на удивление скуден. Помимо недавних работ по применению DRL к маркетмейкингу на смоделированных высокочастотных данных, литературы по применению DRL к реальным высокочастотным данным стакана не существует. В настоящей работе мы пытаемся заполнить этот пробел.

4. Методы

4.1. Данные

Краеугольным камнем исследования служат высококачественные данные стакана из набора LOBSTER — широко принятого в литературе по микроструктуре, дающего детальное пособытийное описание всей микромасштабной рыночной активности для каждой акции, торгуемой на NASDAQ. Набор перечисляет каждое поступление рыночной заявки, поступление лимитной заявки и снятие с 09:30 до 16:00 каждого торгового дня. Минимальный размер тика для всех акций NASDAQ равен $\theta = 0{,}01$ доллара. Для каждого активного торгового дня предоставляется эволюция стакана до 10 уровней. Отметим, что долларовая цена каждой заявки умножена на 10 000.

Эксперименты выполняются на реконструированном стакане акции Intel Corporation (INTC), известной как одна из наиболее торгуемых крупнотиковых акций на NASDAQ. Высокая рыночная активность может как помогать обучению DRL (агент исследует более широкую область фазового пространства), так и мешать (более низкое отношение сигнала к шуму, поскольку ценовой процесс эффективнее), но выбор именно крупнотиковой акции определённо полезен. Цены крупнотиковых акций, то есть акций с широкими ценовыми уровнями, известны как менее стохастические и более зависимые от доступной информации стакана, чем у малотиковых. Кроме того, поскольку каждый тик имеет значимый размер, стакан плотный, что позволяет передавать агенту одни лишь объёмы без потери информации.

Обучающий набор состоит из 60 файлов (по одному на торговый день с 04.02.2019 по 30.04.2019), валидационный — из 22 (с 01.05.2019 по 31.05.2019), тестовый — из 20 (с 03.06.2019 по 28.06.2019). Все эксперименты проводятся на снимках стакана глубиной 10 уровней с каждой стороны. Из-за существенно иной динамики и более высокой волатильности периоды открытия и закрытия рынка исключены и из обучающей, и из тестовой выборки для каждого дня (первые и последние $2 \times 10^5$ тиков) — чтобы облегчить обучение агента в нормальных рыночных условиях.

4.2. Модели

Рассматриваются три сценария обучения и тестирования, различающиеся лишь способом характеризации состояния агента $S$:

При всех определениях состояния в каждый тиковый момент $\tau$ агент выбирает действие из множества $A = \{a_i\}_{i=0}^{3} = \{\text{продать},\ \text{ждать},\ \text{купить},\ \text{дневной стоп-лосс}\}$. Исход каждого действия зависит от позиции агента $P = \{\text{нейтральная},\ \text{длинная},\ \text{короткая}\}$. Пара «позиция — действие» полностью определяет взаимодействие агента со средой:

Прибыль от закрытия в момент $\tau$ длинной или короткой позиции, открытой в момент $\tau - t$, определяется как $R_{l/s} = p^{\text{best}}_{a/b,\tau} - p^{\text{best}}_{b/a,\tau-t}$, то есть чистая долларовая доходность сделки (разность цен минус стоимость сделки). Включение пересечения спреда — торговля по ценам покупки и продажи, а не по средней — напрямую учитывает транзакционные издержки и делает эксперимент реалистичнее. Смысл введения дневного стоп-лосса в том, что агент может пропустить целую среду (день), если при текущей политике реализовать прибыльную стратегию слишком трудно.

Функция вознаграждения совпадает с прибылью для всех действий, кроме стоп-лосса.

Наконец, необходимо замечание. Внимательный читатель заметит, что определённый нами агент способен торговать и держать в запасе лишь одну единицу актива. Хотя это может показаться нереалистичным допущением, ограничивающим применимость метода, мы утверждаем обратное.

Всякое действие агента в стакане изменяет сам стакан и влияет на будущие действия и реакции других участников. Каждый раз, покупая (продавая) одну или несколько единиц актива, мы потребляем ликвидность на стороне продажи (покупки). Это простое действие создаёт избыток спроса, толкающий цену вверх (вниз) пропорционально корню из размера заявки. Торгуя лишь одной единицей, мы уверены, что ликвидности достаточно (минимум — одна единица) для исполнения по лучшей цене без потребления ликвидности на более высоких уровнях, что ухудшило бы цену исполнения. Кроме того, крупные сделки обычно дробятся на меньшие единицы, исполняемые раздельно. Переменный размер заявки потребовал бы более сложной стратегии исполнения и учёта самовоздействия на цену. Таким образом, наш выбор единичной торговли поддерживает простоту и применимость фреймворка к живым сценариям.

4.3. Конвейер обучения и тестирования

Все эксперименты организованы в три отдельные стадии.

  1. Обучение выполняется с применением подхода непрерывного обучения. Для каждого из 82 доступных торговых дней отбираются 5 снимков стакана по $10^4$ последовательных тиков каждый; снимки включают наибольшие абсолютные разности средних цен за день. Из них сэмплируется лишь 25 снимков, преобразуемых в векторизованные среды DRL. Такая процедура позволяет выбрать данные с высоким отношением сигнала к шуму и с ценовыми изменениями, которые вероятнее пригодны для действий. Каждая среда прогоняется 30 эпох. Сеть политики агента — простой многослойный перцептрон из двух скрытых слоёв по 64 нейрона, общих для сети действия и сети ценности; последний скрытый слой отображается напрямую в два одномерных выхода (действие и ценность).
  2. Байесовская оптимизация отдельных гиперпараметров (скорости обучения и коэффициента энтропии) выполняется на валидационной выборке, среды которой сэмплируются аналогично обучающим. Регрессор на гауссовских процессах с квадратично-экспоненциальным ядром подгоняет неизвестную функцию, отображающую значения гиперпараметров во вневыборочные вознаграждения. Исходя из накопленной прибыли по всем валидационным дням, следующая точка для оценки итеративно выбирается функцией ожидаемого улучшения.
  3. Тестирование: выученная политика независимо проверяется на всех днях тестовой выборки. Накопленная дневная прибыль обновляется при каждом закрытии позиции, а соответствующее вознаграждение записывается для построения траектории прибыли и убытка.

5. Результаты и обсуждение

Мы приводим вневыборочные результаты для ансамблей DRL-моделей по трём определениям состояния. Для сравнения рассматриваются: накопленная прибыль и убыток по тестовым дням, среднее и стандартное отклонение дневной прибыли по итерациям, а также распределение доходностей сделок агента.

Рисунок 2
Рисунок 2. Накопленная средняя доходность по 30 элементам ансамбля (a), дневная средняя накопленная доходность со стандартным отклонением (b) и распределение доходностей сделок (c) для всего теста (20 дней) при определении состояния $S_{c201}$. Значения прибыли напрямую зависят от того, что в данных LOBSTER долларовая цена каждой заявки умножена на 10 000.
Рисунок 3
Рисунок 3. То же для определения состояния $S_{c202}$.
Рисунок 4
Рисунок 4. То же для определения состояния $S_{c203}$.

Начнём с того, что агенты способны порождать прибыльные стратегии (за вычетом торговых издержек) в среднем по своим ансамблям при каждом определении состояния. Наблюдается значительное улучшение как по величине накопленной прибыли, так и по более устойчивому восходящему тренду при переходе от $S_{c201}$ к $S_{c202}$. Вариант $S_{c203}$ показывает хороший результат по сравнению с $S_{c201}$, но уступает $S_{c202}$.

Это позволяет предположить, что переоценка по рынку, добавленная в $S_{c202}$, крайне информативна относительно ожидаемого вознаграждения агента и заметно улучшает сходимость и результат. С другой стороны, спред, включённый в $S_{c203}$, результата не улучшает — вероятно, из-за того, что у крупнотиковых акций он в основном постоянен. Превосходство $S_{c203}$ над $S_{c201}$, скорее всего, обусловлено именно наличием переоценки по рынку.

Графики дневных средних прибылей с доверительными интервалами в одно стандартное отклонение показывают положительную асимметрию средних и интервалов, а также тренд во времени, причём отдельные дни волатильнее прочих. Эти графики позволяют увидеть результаты агентов в разных рыночных условиях и ясно показывают, что прибыли не характеризуются дневной сезонностью и не сосредоточены в считанных днях: большинство дней тестовой выборки дают положительную доходность, и положительные доходности в среднем больше отрицательных.

Вариант $S_{c202}$ достигает уровней прибыли на порядок выше прочих. Это означает, что агент использует больше торговых возможностей: располагая информацией о текущей нереализованной прибыли, он входит и выходит из позиций плавнее. Действительно, кривые дневной доходности глаже, а число сделок на два порядка выше, чем у $S_{c201}$, и на порядок выше, чем у $S_{c203}$.

Глядя на распределения доходностей отдельных сделок, сразу замечаешь различие в частоте торговли между характеризациями состояния. При этом сами распределения реализованной прибыли широко схожи по форме тела и наличию хвостов с положительной асимметрией и пиком около нуля. Обрезание отрицательного хвоста можно отнести на счёт доступного агенту дневного стоп-лосса. Как и ожидалось, почти симметричное тело распределения указывает на ограниченную предсказуемость цены: многие сделки прекращаются рано с равновероятными положительными и отрицательными исходами.

Различие возникает на бо́льших доходностях, и авторы предлагают следующие возможные объяснения: спред (стоимость торговли) оказывает меньшее влияние; крупные ценовые движения возникают из неэффективностей, поддающихся эксплуатации; и при отсутствии значимой предсказуемости цены хорошее управление позицией позволяет получать положительную прибыль. Последнее, вероятно, применимо к $S_{c202}$ и $S_{c203}$, тогда как редкие неэффективности могут быть источником прибыли для $S_{c201}$. Это прямо показывает, что рынки неэффективны — не в смысле предсказуемости цены, а в смысле возможности извлечь прибыль — по крайней мере на коротких промежутках в микроструктурной области. Такой вывод, вероятно, связан с тем, что стратегия основана на новых методах DRL, ещё не получивших широкого распространения в этой области и потому не успевших устранить эти неэффективности.

Изучая тела распределений и их хвосты, мы не находим убедительных оснований объяснить столь различные профили доходности между характеризациями состояния. Что действительно определяет разницу — это число сделок. Агенты, знающие свою переоценку по рынку, располагают точной информацией о потенциальном вознаграждении и должны лишь оценить, стоит ли удерживать позицию ради дальнейшего роста. Это позволяет использовать больше торговых возможностей.

6. Ограничения

Представленный метод имеет ряд ограничений. Одно из них — неэффективность по выборке, обычная для RL. То, что агент получает вознаграждение лишь при закрытии позиции, означает, что обратная связь приходит не чаще его сделок. В нашем случае позиции удерживаются десятки, сотни и даже тысячи шагов, что замедляет сходимость и делает функцию вознаграждения разреженной.

Кроме того, учитывая трудность задачи и разреженность вознаграждения, мы наблюдаем, что изредка агент не может должным образом инициализироваться — сходится к субоптимальной политике вроде полного отказа от торговли. Это ожидаемо и следует из политики исследования алгоритма PPO и отрицательной ожидаемой доходности в начале стадии исследования. Ситуацию могли бы облегчить временна́я агрегация входных рядов ради снижения разреженности вознаграждения или использование алгоритмов RL с более подходящей политикой исследования, но это оставлено будущей работе.

7. Заключение

В работе показано, как успешно обучать и разворачивать модели DRL в контексте высокочастотной торговли. Мы исследуем, как три различных определения состояния влияют на вневыборочные результаты агентов, и находим, что знание переоценки текущей позиции по рынку крайне полезно и для глобальной функции прибыли, и для вознаграждения по отдельной сделке. Однако следует отметить, что независимо от определения состояния агенты всегда способны «обыграть рынок» и достичь чистой положительной прибыли на всей рассмотренной выборке и в большинстве составляющих её торговых дней.

Хотя мы рассмотрели агента, покупающего по лучшей цене продажи и продающего по лучшей цене покупки (и потому вынужденного платить спред при закрытии позиции), проделанное упражнение — лишь первая попытка реалистично применить алгоритм DRL в столь выраженно нестационарной среде, как лимитный стакан и финансовые рынки. Прежде всего, мы рассмотрели агента, способного торговать лишь одной единицей актива, и потому безопасно сочли воздействие его сделок на рынок нулевым. Однако хорошо известно, что в реалистичной постановке, где можно покупать и продавать множество единиц, воздействие собственных сделок серьёзно влияет на итоговую прибыль стратегии.

Тем не менее сам факт, что даже в упрощённой постановке DRL-агент может показывать хорошие результаты в крайне стохастической и нестационарной среде, заслуживает внимания. Более того, способность порождать вневыборочно прибыльные стратегии показывает, что временны́е рыночные неэффективности существуют и могут быть использованы для получения долговременной прибыли, — что добавляет ещё одно свидетельство против давнего убеждения о внутренней эффективности рынков.

Литература

Оригинал статьи: Briola, A., Turiel, J., Marcaccioli, R., Cauderan, A., Aste, T., «Deep Reinforcement Learning for Active High Frequency Trading», arXiv:2101.07107 · лицензия CC BY-NC-SA 4.0