FinRL-DeepSeek: обучение с подкреплением с учётом риска и подмешиванием LLM для торговых агентов
Мостафа Бенхенда · 11 февраля 2025
Оригинал: Benhenda, M. «FinRL-DeepSeek: LLM-Infused Risk-Sensitive Reinforcement Learning for Trading Agents», 2025 — arxiv.org/abs/2502.07393 (PDF).
Код, данные и агенты: github.com/benstaf/FinRL_DeepSeek.
Рисунки воспроизведены из оригинальной публикации. Оригинал распространяется по стандартной лицензии arXiv (non-exclusive distribution), которая производных произведений не разрешает: все права на оригинальный текст принадлежат автору, перевод выполнен для личного ознакомления с указанием источника.
Аннотация
В работе представлен новый торговый агент, чувствительный к риску, сочетающий обучение с подкреплением и большие языковые модели. Мы расширяем алгоритм оптимизации политики с ограничением по условной стоимости под риском (CVaR-PPO, он же CPPO), добавляя сигналы оценки риска и торговых рекомендаций, порождаемые языковой моделью из финансовых новостей. Подход протестирован на исторических данных по бенчмарку индекса Nasdaq-100 с использованием новостных данных из набора FNSPID и языковых моделей DeepSeek V3, Qwen 2.5 и Llama 3.3.
1. Введение
Автоматизированные торговые агенты всё активнее используют обучение с подкреплением, но часто упускают из виду два аспекта:
- интеграцию альтернативных источников данных, таких как финансовые новости;
- управление риском.
В работе вводится гибридный торговый агент RL + LLM, учитывающий сведения из финансовых новостей одновременно на уровне действий и на уровне риска. Основной вклад — введение оценки риска на основе LLM, извлекаемой из новостей, в дополнение к торговым рекомендациям, также порождаемым LLM. Это демонстрирует потенциал языковых моделей для извлечения признаков из новостей за пределами стандартного анализа тональности — за счёт тщательно спроектированных промптов.
2. Связанные работы
Существует растущий корпус работ по агентам RL, дополненным языковыми моделями. По сравнению с ними способ, которым LLM влияет на RL-агента, здесь проще.
В FinGPT обучение с подкреплением применяется к обучению самой языковой модели на ценах акций. Этот подход сложнее нашего, преимущество которого — в опоре на устоявшиеся API языковых моделей.
Другие гибридные подходы RL + LLM включают FinCon, где выполняется сложная дистилляция информации через синтезированный механизм многоагентного взаимодействия. В настоящей работе используются лишь простые промпты. Эти подходы отличаются также от «чисто LLM»-агентов, которые опираются только на рекомендации языковой модели.
3. Данные и промпты для LLM
Мы используем набор данных FNSPID, содержащий 15,7 млн выровненных по времени финансовых новостных записей за 1999–2023 годы. Чтобы снизить издержки на вызовы API языковых моделей, мы случайным образом отбираем по одной представительной новостной статье на акцию в день, сокращая набор до 2 млн записей. С помощью моделей DeepSeek V3, Qwen 2.5 72B и Llama 3.3 70B мы извлекаем рекомендации по акциям и оценку риска, используя следующие промпты.
Промпт торговой рекомендации (из работы по FNSPID):
«Вы — финансовый эксперт с опытом рекомендаций по акциям. Применительно к конкретной акции поставьте оценку в диапазоне от 1 до 5, где 1 — негативно, 2 — скорее негативно, 3 — нейтрально, 4 — скорее позитивно, 5 — позитивно».
Промпт оценки риска (новый):
«Вы — финансовый эксперт, специализирующийся на оценке риска для рекомендаций по акциям. Применительно к конкретной акции дайте оценку риска от 1 до 5, где: 1 означает очень низкий риск, 2 — низкий риск, 3 — умеренный риск (по умолчанию, если новость не содержит явных указаний на риск), 4 — высокий риск, 5 — очень высокий риск».
4. Торговые алгоритмы
4.1. Агенты RL только на ценовых данных
4.1.1. Проксимальная оптимизация политики (PPO)
Алгоритм PPO обеспечивает устойчивые обновления политики за счёт обрезания отношения вероятностей:
$$L^{\text{PPO}}(\theta) = \mathbb{E}\left[\min\left(r_t(\theta)\cdot A_t,\ \operatorname{clip}\left(r_t(\theta),\ 1-\epsilon,\ 1+\epsilon\right)\cdot A_t\right)\right]$$
где $r_t(\theta) = \frac{\pi_\theta(a_t \mid s_t)}{\pi_{\theta_{old}}(a_t \mid s_t)}$ — отношение вероятностей между новой политикой $\pi_\theta$ и старой $\pi_{\theta_{old}}$; $A_t$ — оценка преимущества в момент $t$; $\epsilon$ — параметр обрезания, ограничивающий большие обновления политики.
4.1.2. PPO с условной стоимостью под риском (CVaR-PPO)
CVaR-PPO расширяет PPO ограничением по риску, штрафующим траектории с крупными потерями:
$$L^{\text{CVaR-PPO}}(\theta, \eta, \lambda) = L^{\text{PPO}}(\theta) + \lambda\left(\frac{1}{1-\alpha}\mathbb{E}\left[(\eta - D(\pi_\theta))^+\right] - \eta + \beta\right) \tag{1}$$
где $D(\pi_\theta)$ — доходность траектории; $\eta$ — порог CVaR; $(\eta - D(\pi_\theta))^+ = \max(0,\ \eta - D(\pi_\theta))$ — потеря CVaR за порогом; $\lambda$ — множитель Лагранжа, обеспечивающий ограничение; $\alpha$ — уровень доверия CVaR (например, 0,05 для худших 5%); $\beta$ — вспомогательный штрафной параметр.
Насколько нам известно, мы первыми применяем CVaR-PPO к торговле акциями.
4.2. PPO с подмешиванием LLM
В этом варианте мы вычисляем по данным FNSPID специфичные для акции оценки рекомендаций $S_f$ с помощью языковой модели. Эти оценки влияют на торговые действия. Изменённое действие:
$$a_t^{\text{mod}} = S_f \cdot a_t$$
где $S_f > 1$ усиливает действие при позитивной рекомендации, $S_f < 1$ ослабляет при негативной, а $S_f = 1$ оставляет действие без изменений.
Возмущение $S_f$ выбирается близким к единице ради устойчивости алгоритма. Например:
- $S_f = 1{,}1$, если оценка акции равна 5 и $a_t > 0$, либо оценка равна 1 и $a_t < 0$;
- $S_f = 1{,}05$, если оценка равна 4 и $a_t > 0$, либо оценка равна 2 и $a_t < 0$;
- $S_f = 0{,}95$, если оценка равна 4 и $a_t < 0$, либо оценка равна 2 и $a_t > 0$;
- $S_f = 0{,}9$, если оценка равна 5 и $a_t < 0$, либо оценка равна 1 и $a_t > 0$.
4.3. CVaR-PPO с подмешиванием LLM (CPPO)
Финансовые новости из FNSPID обрабатываются языковой моделью для порождения оценок риска $R_f^i$ по каждой акции $i$ и каждому дню. Возмущение $R_f^i$ также выбирается близким к единице:
- $R_f^i = 1{,}1$ при очень высокой оценке риска 5;
- $R_f^i = 1{,}05$ при высокой оценке 4;
- $R_f^i = 1$ при умеренной оценке 3;
- $R_f^i = 0{,}95$ при низкой оценке 2;
- $R_f^i = 0{,}9$ при очень низкой оценке 1.
Агрегированная оценка риска определяется как
$$R_f = \sum_i w_i R_f^i$$
где $w_i$ — финансовый вес акции $i$ в портфеле, причём $\sum_i w_i = 1$.
Эти оценки корректируют доходности траекторий в CVaR-PPO, отражая рыночный риск. Скорректированная доходность:
$$D_{R_f}(\pi_\theta) = R_f \cdot D(\pi_\theta)$$
В итоге финансовые новости влияют на торговые действия двумя путями: через $S_f$ и через $R_f$.
5. Результаты
5.1. Ранняя остановка: 400–500 тыс. шагов обучения
В этих тестах используется 10-процентное подмешивание LLM, то есть исходные PPO и CPPO изменяются не более чем на 10%.
Рисунок 1 — смотреть в оригинале (PDF)
Рисунок 1. Период обучения 2019–2022, 500 тыс. итераций (25 эпох по 20 тыс. шагов), период торговли — 2023 год. Эти предварительные результаты с Qwen 2.5 показывают, что интеграция рекомендаций LLM стабильно улучшает PPO по накопленной доходности. Однако этого пока недостаточно, чтобы обойти бенчмарк Nasdaq-100.
Рисунок 2 — смотреть в оригинале (PDF)
Рисунок 2. Период обучения 2013–2018, 400 тыс. итераций (20 эпох по 20 тыс. шагов), период торговли 2019–2023. Результаты показывают значительное улучшение при более длинном периоде обучения (6 лет против 3) как для PPO, так и для CPPO. Однако PPO остаётся слишком волатильным. DeepSeek V3 немного лучше Llama 3.3 при прочих равных. В этом тесте использование LLM всегда ухудшает результат.
5.2. После обучения на 2 млн шагов
Рисунок 3 — смотреть в оригинале (PDF)
| Модель | Information Ratio | CVaR | Коэффициент Рачева |
|---|---|---|---|
| PPO (100 эпох) | 0,0100 | −0,0394 | 1,0637 |
| CPPO (100 эпох) | −0,0148 | −0,0439 | 1,0404 |
| PPO-DeepSeek (100 эпох) | −0,0093 | −0,0338 | 0,9890 |
| CPPO-DeepSeek (100 эпох) | 0,0078 | −0,0437 | 0,9818 |
Рисунок 4 — смотреть в оригинале (PDF)
В этих двух прогонах (RL-агенты стохастичны) PPO и CPPO-DeepSeek превосходят прочие методы, включая бенчмарк Nasdaq-100. PPO, по-видимому, лучше работает на бычьих рынках, а CPPO-DeepSeek — на медвежьих; переход приходится на конец 2021 года, перед войной на Украине и последовавшим кризисом.
5.3. Влияние силы подмешивания LLM
В следующих тестах параметры силы подмешивания LLM изменяются от 10% до 0,1% (то есть параметры возмущения варьируются от диапазона 0,9–1,1 до диапазона 0,999–1,001).
Рисунок 5 — смотреть в оригинале (PDF)
| Модель | Information Ratio | CVaR | Коэффициент Рачева |
|---|---|---|---|
| PPO | 0,0100 | −0,0394 | 1,0637 |
| PPO-DeepSeek 10% | −0,0093 | −0,0338 | 0,9890 |
| PPO-DeepSeek 1% | −0,0252 | −0,0459 | 1,0394 |
| PPO-DeepSeek 0,1% | −0,0011 | −0,0375 | 0,9536 |
Для PPO-DeepSeek более сильное подмешивание LLM преимущественно ухудшает результат — даже при крошечных возмущениях в 0,1%.
Рисунок 6 — смотреть в оригинале (PDF)
| Модель | Information Ratio | CVaR | Коэффициент Рачева |
|---|---|---|---|
| CPPO | −0,0148 | −0,0439 | 1,0404 |
| CPPO-DeepSeek 10% | 0,0078 | −0,0437 | 0,9818 |
| CPPO-DeepSeek 1% | −0,0032 | −0,0365 | 0,9573 |
| CPPO-DeepSeek 0,1% | −0,0060 | −0,0441 | 0,9789 |
Для CPPO-DeepSeek, напротив, более сильное подмешивание LLM улучшает результат.
6. Заключение
Мы предлагаем RL-агентов с подмешиванием LLM для алгоритмической торговли, интегрирующих торговые рекомендации и оценки риска из новостей. Направления дальнейшей работы:
- Оптимизация использования оперативной памяти. Более длительное обучение требует больше памяти: 500 тыс. шагов обучения потребовали 16 ГБ (плюс файл подкачки), тогда как 2 млн шагов — уже 128 ГБ (плюс подкачка). Повышение эффективности по памяти критично для масштабируемости.
- Сокращение масштаба времени. Поскольку рынки реагируют на события быстро и резко, уменьшение временно́го шага принятия решений могло бы улучшить торговый результат.
- Повышение качества новостного сигнала. Улучшение качества сигналов из набора FNSPID — важное направление для достижения лучших рыночных показателей.
Литература
- DeepSeek-AI и соавторы, DeepSeek-V3 technical report, arXiv:2412.19437 (2024).
- Q. Ding, H. Shi, B. Liu, TradeXpert: revolutionizing trading with mixture of expert LLMs, arXiv:2411.00782 (2024).
- Z. Dong, X. Fan, Z. Peng, FNSPID: a comprehensive financial news dataset in time series, arXiv:2402.06698 (2024).
- A. Grattafiori и соавторы, The Llama 3 herd of models, arXiv:2407.21783 (2024).
- S. Lele, K. Gangar, H. Daftary, D. Dharkar, Stock market trading agent using on-policy reinforcement learning algorithms, SSRN (2020).
- X.-Y. Liu и соавторы, FinRL: a deep reinforcement learning library for automated stock trading in quantitative finance, arXiv:2011.09607 (2022).
- A. Lopez-Lira, Y. Tang, Can ChatGPT forecast stock price movements?, arXiv:2304.07619 (2024).
- Qwen и соавторы, Qwen 2.5 technical report, arXiv:2412.15115 (2025).
- J. Schulman, F. Wolski, P. Dhariwal, A. Radford, O. Klimov, Proximal policy optimization algorithms, arXiv:1707.06347 (2017).
- A. Unnikrishnan, Financial news-driven LLM reinforcement learning for portfolio management, arXiv:2411.11059 (2024).
- H. Yang, X.-Y. Liu, C. D. Wang, FinGPT: open-source financial large language models, arXiv:2306.06031 (2023).
- C. Ying, X. Zhou, H. Su, D. Yan, N. Chen, J. Zhu, Towards safe reinforcement learning via constraining conditional value-at-risk, IJCAI-22 (2022) 3673–3680.
- Y. Yu и соавторы, FinCon: многоагентная система с механизмом синтезированного взаимодействия (2024).
Оригинал статьи: Benhenda, M., «FinRL-DeepSeek: LLM-Infused Risk-Sensitive Reinforcement Learning for Trading Agents», arXiv:2502.07393 · код: benstaf/FinRL_DeepSeek