Large Language Model Agent in Financial Trading: A Survey

4.5/10

Хань Дин, Иньхэн Ли, Цзюньхао Ван, Хан Чэнь, Доудоу Го, Юньбай Чжан · 26 июля 2024 (v1), обновление 1 марта 2026 (v2)

Columbia University; New York University. Все авторы внесли равный вклад; порядок случайный.

Оригинал: Ding, H. et al. «Large Language Model Agent in Financial Trading: A Survey», 2024 — arxiv.org/abs/2408.06361 (PDF), лицензия CC BY 4.0.

Рисунки и таблица воспроизведены из оригинальной публикации. Перевод выполнен с указанием источника в соответствии с условиями лицензии CC BY 4.0.

Ключевые слова: большие языковые модели, агент, управление активами, количественная торговля.

Аннотация

Торговля — высококонкурентная задача: нужна смесь стратегии, знаний и психологической устойчивости. После успеха больших языковых моделей (LLM) естественно спросить, можно ли перенести возникающий интеллект LLM-агентов на этот рынок и способны ли они обойти профессиональных трейдеров. Обзор систематизирует текущие работы по LLM как агентам финансовой торговли: типичные архитектуры, входные данные, результаты бэктестов и открытые проблемы. Цель — зафиксировать состояние области и наметить направления исследований.

CCS Concepts: Computing methodologies → Natural language processing; Information extraction; Intelligent agents.

1. Введение

Прогресс LLM перестроил NLP и показал потенциал автономных агентов [46]. Такие агенты уже пробуют в здравоохранении [32] и образовании [59]; в финансах LLM тоже активно исследуют [23, 26]. Отдельный тренд — LLM-агенты для торговли. Профессиональный трейдер обязан быстро перерабатывать разнородную информацию и принимать решения; LLM хорошо подходят именно к этой роли: быстро обрабатывают большие объёмы текста и выдают сжатые выводы.

Мы систематически разбираем работы, где LLM выступает агентом финансовой торговли, ищем общие линии и формулируем вопросы к будущему:

Тема молодая: относительно мало работ явно применяют агентный каркас к торговле. Мы просмотрели 27 статей про LLM в финансовой торговле, из них семь содержат слово «agent» в заголовке. Поиск — Google Scholar по запросам вроде «LLM for trading» и «GPT stock agent»; каждую работу вручную проверяли на релевантность. Насколько нам известно, это первый обзор вклада именно LLM-агентов в финансовую торговлю.

Смежные переводы на сайте: проблема запоминания в экономических прогнозах LLM, QTNet.

2. Архитектура

Архитектура — ключевой выбор при проектировании LLM-агента, и её обычно диктует цель. Главная цель торгового агента — максимизировать доходность решений на заданном горизонте. Риск-метрики тоже важны; их разберём в §4. LLM-агентов строят и для других финансовых задач — суммаризация новостей [1], финансовые консультации [21], — но здесь фокус на агентах, которые зарабатывают инвестиционную доходность: это основная масса работ.

Два крупных класса: LLM как трейдер и LLM как майнер альф. Трейдер напрямую выдаёт решение (BUY / HOLD / SELL). Майнер альф использует LLM как инструмент для качественных альфа-факторов, которые затем встраивают в нижестоящую торговую систему. Иерархия показана на рис. 1.

Дерево архитектур финансовых LLM-агентов: трейдер (новости, рефлексия, дебаты, RL) и майнер альф (AlphaGPT, QuantAgent)
Рис. 1. Обзор архитектур финансовых LLM-агентов.

2.1. LLM как трейдер

Здесь LLM напрямую принимает торговое решение. Система анализирует внешние данные — новости, отчёты, цены — и извлекает из них сигнал покупки или продажи. Подтипы: новостные, рефлексивные, дебатные и RL-агенты.

2.1.1. Новостные

Самый базовый тип: новости по бумаге и макрообновления кладут в контекст промпта, LLM предсказывает движение цены на следующий торговый период. Работы [29, 50] сравнивают закрытые модели (GPT-3.5/4) и открытые (Qwen [3], Baichuan [52] и др.) в финансовом сентимент-анализе и бэктестируют простой long-short по сентимент-скорам — стратегия работает. [18, 56] смотрят LLM, дообученные на финансовом корпусе (FinGPT, OPT и др.), и показывают дополнительный выигрыш от выравнивания под предметную область.

Более сложные схемы: суммаризация и очистка новостей плюс рассуждение о связи новости и движения цены. [10] строит несколько суммаризаторов — прогрессивную дневную сводку новостей, фундаментальную и макросводку, сводку ценового моментума. Сводки хранит модуль запоминания («память»); на этапе торговли релевантная память поднимается как контекст «рекомендации» для финального решения. Авторы отмечают сильный in-context learning у универсальных моделей вроде GPT-4 [36] на финансовых задачах. LLMFactor [47] сначала просит LLM выделить важные факторы, анализируя связь исторических новостей и последующего движения цены, затем извлекает эти факторы из дневных новостей и прогнозирует цену.

Часть подходов ближе к продвинутому LLM-методу с zero-shot или in-context learning [24, 42], чем к агентной системе; мы включаем их для полноты картины.

2.1.2. Рефлексивные

Рефлексия [38] строится поверх извлечённой памяти через суммаризацию LLM: это знания высокого уровня, постепенно агрегируемые из сырых воспоминаний и наблюдений. По ним принимают торговые решения.

FinMem [53] — торговый агент со слоистой памятью и «характером». Сырой вход (дневные новости, финансовые отчёты) сжимается в воспоминания. При новых наблюдениях релевантная память поднимается и вместе с ними порождает рефлексии. И память, и рефлексии лежат в слоистом «ведре». На торговой фазе их извлекают модулем решений. Критерии извлечения: свежесть, релевантность, важность.

FinAgent [57] — первый мультимодальный агент с похожей слоистой памятью и рефлексией плюс модуль, принимающий числа, текст и изображения. Модуль решений дополнительно берёт технические индикаторы — MACD [9] и RSI [11] — и аналитические рекомендации, чтобы ловить рыночную динамику. На бэктесте схема обходит другие агенты, включая FinMem.

Память и рефлексия имеют корень в когнитивной науке [6]: человек взаимодействует со средой, впитывает обратную связь, формирует воспоминания и применяет уроки. Те же механизмы у LLM-агентов снижают риск галлюцинаций [15] и дают понимание среды более высокого уровня [39].

2.1.3. Дебатные

Дебаты между LLM усиливают рассуждение и фактическую корректность; приём широко используется и в финансовых агентах. [51] предлагает гетерогенный дебатный каркас: агенты с разными ролями (настроение, риторика, зависимости и т.д.) спорят друг с другом — это улучшает классификацию новостного сентимента. TradingGPT [27] близок к FinMem [53], но добавляет шаг: агенты оспаривают действия и рефлексии друг друга, повышая устойчивость рефлексий.

2.1.4. С обучением с подкреплением

Методы вроде RLHF [37] и RLAIF [22] хорошо выравнивают выходы LLM с желаемым поведением. Узкое место — получать качественную обратную связь дёшево и системно. В торговле бэктест даёт относительно дешёвую обратную связь по решениям и естественно служит источником награды.

SEP [19] совмещает RL с модулями памяти и рефлексии: последовательность верных и неверных прогнозов по рыночной истории уточняет предсказания LLM на живых данных.

RL само по себе — классический метод решений в играх и торговле [16]. [8] строит RL-каркас из Local-Global (LG) модели и Self-Correlated Reinforcement Learning (SCRL) на многослойных перцептронах. LLM делает эмбеддинги заголовков новостей, проецирует их в пространство признаков бумаги; эмбеддинги смешиваются с уже имеющимися признаками и идут на вход LG. LG — сеть политики, обучается PPO [43] на траекториях торгового периода обучения.

2.2. LLM как майнер альф

Второй класс: LLM не торгует сам, а генерирует альфа-факторы. QuantAgent [48] делает это через архитектуру внутренний цикл / внешний цикл. Во внутреннем цикле агент-писатель берёт общую идею человека-трейдера и пишет скрипт; агент-судья даёт фидбек и уточняет код. Во внешнем цикле принятый код тестируют на реальном рынке, а торговый результат усиливает судью. Показано, что агент постепенно приближается к лучшему поведению с разумной эффективностью. В следующей работе AlphaGPT [49] предлагает human-in-the-loop майнинг альф: тот же каркас плюс экспериментальная среда. Обе работы демонстрируют эффективность LLM-майнинга — это ценно, потому что поиск альф ресурсоёмок.

2.3. Выбор LLM в агенте

Гистограмма на рис. 2 показывает спектр базовых моделей. Доминируют модели OpenAI, особенно GPT-3.5 и GPT-4, из-за общей силы. Длинный хвост открытых моделей закрывает потребность в гибкой и специализированной разработке. GPT-3.5 используют даже чаще GPT-4: дешевле и ниже латентность.

Гистограмма базовых LLM в финансовых агентах: GPT-3.5 — 9, GPT-4 — 8, BERT и FinBERT — по 2, остальные по 1
Рис. 2. Гистограмма базовых LLM в финансовых агентах (одна статья может содержать несколько агентов). GPT-3.5 — 9, GPT-4 — 8, BERT и FinBERT — по 2; Qwen, Baichuan, OPT, Erlangshen, Llama-2-70B, Vicuna-7B, FinGPT, BloombergGPT, BLOOMZ, Gemini — по 1.

3. Данные

LLM-торговые агенты сильно зависят от разнородных источников сигнала. Мы сгруппировали используемые типы в четыре класса:

3.1. Числовые данные

В классическом кванте числа — основа [2, 31]. LLM изначально заточены под текст, поэтому числа приходится превращать в строки. Несмотря на известную слабость LLM в арифметике и рассуждении [12], числовые данные успешно включают в торговых агентов. [57] считает простые ценовые признаки (например, трёхдневное изменение) по сырым ценам; LLM описывает и суммаризирует их в кратко-, средне- и долгосрочные сигналы — это нижний слой рефлексии.

В [48] дополнительно используют open/close, high/low, чтобы порождать торговые идеи для внешнего цикла обратной связи и оценивать сгенерированную альфа-стратегию. Числа необходимы: они напрямую отражают характер рынка. Высокий объём и растущая цена обычно сигнализируют позитивные ожидания и коррелируют с результатами компании.

3.2. Текстовые данные

Новости и отчёты критичны для трейдера. Все рассмотренные LLM-агенты используют текстовые финансовые данные. По отраслевой терминологии делим текст на фундаментальные и альтернативные данные.

3.2.1. Фундаментальные данные

Это характеристики и метрики, по которым судят об устойчивости актива. В LLM-агентах — финансовые отчёты и аналитические записки.

Финансовые отчёты. Формы 10-Q и 10-K дают картину результатов компании, финансового состояния и ожиданий. Их широко используют FinMem [53], TradingGPT [27] и FinAgent [57]: отчёты обогащают память агента и питают решения.

Аналитические отчёты. Исследования индустрии дают мнения и прогнозы сверх публичной отчётности и новостей. FinAgent [57] берёт экспертные рекомендации Seeking Alpha как важный вход модуля решений наряду с рыночной разведкой, разбором движения цены и историей собственных сделок.

3.2.2. Альтернативные данные

Нестандартная информация для оценки компаний и рынков, дополняющая отчётность. Даёт агенту отдельный угол зрения.

Новости. Bloomberg, The Wall Street Journal, CNBC Television и профильные платформы — поток о движениях рынка, отраслях и конкретных эмитентах. Широко используются [20, 27, 51, 53, 57]. LLM особенно сильны в извлечении сентимента — потенциально важного торгового сигнала.

Соцсети. Twitter, Stack Exchange, StockTwits, Reddit ловят более неформальные обсуждения в реальном времени. Классический ML на соцсетях для прогноза цены есть [14, 40, 58], но среди обзоренных LLM-агентов реальное время соцсетей использует только SEP [19]: LLM генерирует и суммаризирует ключевые факты из Twitter по заданной бумаге. Направление недоисследовано, потенциал большой.

3.3. Визуальные данные

Числа и текст доминируют; визуальный канал почти не трогают. Причина — существующие LLM плохо понимают финансовые картинки. Мультимодальные модели вроде LLaVA [28] и GPT-4V [35] умеют обрабатывать изображение, но почти не обучались и не оценивались на финансовых визуализациях (свечи, объёмы). Ранний опыт FinAgent [57]: GPT-4V в торговом агенте, свечные и торговые графики вместе с числами и текстом. Прирост относительно FinMem (та же архитектура без картинки) существенен. Это шаг к техническому анализу внутри LLM-каркаса.

3.4. Симулированные данные

Симуляции воспроизводят реальные сценарии и дают инструменты для изучения и рынка, и поведения агента. В [54] группа LLM-агентов с разными «личностями» торгует в симулированной среде: колебания цены, синтетические события (ставки, публикация отчётности), общение через bulletin board. Личности реагируют по-разному; внешние факторы сильно влияют на поведение.

Симуляции также удобны для исследования смещений, этики и устойчивости в экстремальных условиях. [41] задаёт несколько реальных сценариев, включая сильное давление, и смотрит поведение LLM. Модели способны на неэтичные действия: торговать по инсайду и сочинять правдоподобные объяснения, чтобы это скрыть. Это регуляторный риск; такие вопросы нужно закрыть до продакшена.

4. Оценка

В обзоренных работах LLM-агенты показывают сильные результаты на бэктесте. Ниже — торговые стратегии, метрики и бейзлайны.

4.1. Торговая стратегия

LLM выдаёт простые сигналы Buy / Hold / Sell по тексту новостей или отчётности. В FinMem [53] и FinAgent [57] сигнал напрямую становится действием по конкретной бумаге. Для портфеля из многих бумаг типичен ранжирующий подход: нужен числовой скор, по величине которого распределяют капитал.

В FinLlama [20] все бумаги S&P 500 ранжирует LLM: верхние 35% — лонг, нижние 35% — шорт. Похожий long-short в [18, 29] обходит и long-only, и short-only. Напротив, [50] ставит лонг всем бумагам с в целом позитивным новостным сентиментом и шорт — с негативным, без учёта магнитуды скора. Сигнал используется не полностью; в их эксперименте long-short хуже long-only. В [56] бумаги группируют по рангу сигнала: верхняя группа даёт лучшую доходность.

Веса при исполнении — равные или по капитализации. В [18] и [29] портфели, взвешенные по капитализации, чуть доходнее равновзвешенных. Гипотеза авторов: качество текстового сигнала у large-cap лучше из-за смещения новостного покрытия.

4.2. Метрики

Портфельные. Почти все работы используют стандартный набор. Кумулятивная и аннуализированная доходность — прибыльность; коэффициент Шарпа [44] и максимальная просадка — риск. Наблюдение: риск и прибыль считают почти все, торговые издержки — почти никто.

Сигнальные. Портфельные метрики не всегда отражают качество агента или сигнала, поэтому смотрят и предсказательную силу. [18] и [60] используют F1 и accuracy сентимента новостей. [10] и [56] — win rate (доля прибыльных сделок). QuantAgent [48] считает Information Coefficient (IC) [55] — корреляцию предсказанного сигнала с будущей доходностью.

Системные. Обработка информации через коммерческие API вроде ChatGPT почти нигде не тарифицируется в статьях. QuantAgent — единственная работа, которая явно обсуждает стоимость токенов и вычислительную сложность обучения и инференса. Вероятная причина: стоимость генерации обычно мала относительно капитала портфеля.

4.3. Постановка бэктеста

Таблица 1. Длина тестового окна бэктеста.
Число летЧисло статей
0–28
2–52
$\ge 5$4

Большинство работ бэктестирует на реальных рыночных данных. Для однобумажных портфелей берут бумаги с наибольшим объёмом доступных новостей: TSLA, AMZN, MSFT, COIN, NFLX, GOOGL, META, PYPL в [53], [57] и [60]. Для многобумажных — компоненты индексов, S&P 500 [45] и CSI 300 [5].

Почти все агенты тестируют только рынок акций. Из 14 работ с реальными данными 9 — рынок США, 5 — Китай. Только FinAgent [57] выходит на крипту, торгуя ETH [4].

Окна оценки обычно попадают в 2020–2024, совпадая с датой публикации. Медиана тестового периода — всего 1,3 года (табл. 1), точные даты старта и конца выбирают довольно произвольно. Сильные цифры на коротком одиночном окне снижают достоверность результата.

4.4. Бейзлайны и результаты

Бейзлайны делятся на три класса: правила, машинное / глубокое обучение, обучение с подкреплением. В [31, 53, 57] правила — Buy and Hold, Mean Reversion, Short-Term Reversal. Поскольку классификаторы умеют предсказывать новостной сентимент, в бейзлайны входят Random Forest [30], LightGBM [17], LSTM [13], BERT [7]. RL в кванте популярен [25]; PPO [43] и DQN [34] тоже служат бенчмарком в [53, 57].

В целом LLM-агенты выглядят сильно на бэктесте. По обзору [8, 29, 53, 57] аннуализированная доходность на 15–30% выше сильнейшего бейзлайна на реальных данных — это аргумент в пользу потенциала LLM в торговле.

5. Ограничения и направления

Успехи есть, ограничения тоже.

Архитектура. Большинство агентов опирается на закрытые модели (GPT-3.5/GPT-4): вопросы приватности данных и невозможность кастомизации. Почти все работы применяют LLM через in-context learning без дообучения; тонко настраивает модель только [19]. Эффективность fine-tuning торговых агентов остаётся открытым вопросом. Латентность инференса — узкое место, для HFT такие модели непрактичны. Интеграция с существующими торговыми системами в обзоренной литературе почти не обсуждается.

Данные. Текст новостей и фундаментал используют почти все; соцсети — почти никто, хотя они способны двигать рынок (шорт-сквиз GameStop [33]).

Оценка. Бэктест в основном ограничен рынками акций США и Китая; деривативы, облигации, сырьё почти отсутствуют. Окна короткие, издержки редко учитывают. Расширение на другие рынки и учёт комиссий может открыть новые возможности — особенно там, где чувствительность к новостям высока.

Наконец, агенты с разным торговым стилем или «личностью» решают по-разному, но аблаций, разбирающих внутреннее рассуждение LLM, мало. Симулированные среды — перспективный путь к более глубокому пониманию процессов решения.

6. Заключение

Мы систематически разобрали работы, где LLM выступает торговым агентом: архитектура, данные, оценка. Поле молодое, статей пока немного, но потенциал извлекать сигнал из огромных объёмов текста и принимать решения уже виден. Вызовы остаются: зависимость от закрытых моделей и стыковка с существующими торговыми системами и живыми трейдерами — важные направления следующих исследований.

Литература

  1. An, S. et al. (2024). FinVerse: An Autonomous Agent System for Versatile Financial Analysis. arXiv:2406.06379.
  2. Asness, C. S., Moskowitz, T. J. and Pedersen, L. H. (2013). Value and Momentum Everywhere. Journal of Finance 68(3).
  3. Bai, J. et al. (2023). Qwen Technical Report. arXiv:2309.16609.
  4. Buterin, V. and Ethereum Foundation (2024). Ethereum: A Decentralized Platform.
  5. China Securities Index Company (2024). CSI 300 Index.
  6. Chun, M. M. and Johnson, M. K. (2011). Memory: enduring traces of perceptual and reflective attention. Neuron 72(4).
  7. Devlin, J. et al. (2019). BERT: Pre-training of Deep Bidirectional Transformers. arXiv:1810.04805.
  8. Ding, Y. et al. (2023). Integrating Stock Features and Global Information via LLMs. arXiv:2310.05627.
  9. Encyclopaedia Britannica (2023). MACD.
  10. Fatouros, G. et al. (2024). Can Large Language Models Beat Wall Street? arXiv:2401.03737.
  11. Fidelity. Relative Strength Index (RSI).
  12. Hendrycks, D. et al. (2021). Measuring Mathematical Problem Solving With the MATH Dataset. arXiv:2103.03874.
  13. Hochreiter, S. and Schmidhuber, J. (1997). Long Short-Term Memory. Neural Comput. 9(8).
  14. Huynh, D. et al. (2021). Stock Price Prediction Leveraging Reddit. IEEE Big Data.
  15. Ji, Z. et al. (2023). Towards Mitigating Hallucination in LLMs via Self-Reflection. arXiv:2310.06271.
  16. Jiang, Z., Xu, D. and Liang, J. (2017). A Deep Reinforcement Learning Framework for the Financial Portfolio Management Problem. arXiv:1706.10059.
  17. Ke, G. et al. (2017). LightGBM. NeurIPS 30.
  18. Kirtac, K. and Germano, G. (2024). Sentiment trading with large language models. Finance Research Letters 62.
  19. Koa, K. J. L. et al. (2024). Learning to Generate Explainable Stock Predictions using Self-Reflective LLMs. WWW ’24.
  20. Konstantinidis, T. et al. (2024). FinLlama. arXiv:2403.12285.
  21. Lakkaraju, K. et al. (2023). LLMs for Financial Advisement. ICAIF ’23.
  22. Lee, H. et al. (2023). RLAIF. arXiv:2309.00267.
  23. Lee, J. et al. (2024). A Survey of Large Language Models in Finance (FinLLMs). arXiv:2402.02315.
  24. Li, Y. (2023). A Practical Survey on Zero-shot Prompt Design for In-context Learning. RANLP.
  25. Li, Y., Wang, J. and Cao, Y. (2023). A General Framework on Enhancing Portfolio Management with RL. arXiv:1911.11880.
  26. Li, Y. et al. (2024). Large Language Models in Finance: A Survey. arXiv:2311.10723.
  27. Li, Y. et al. (2023). TradingGPT. arXiv:2309.03736.
  28. Liu, H. et al. (2023). Visual Instruction Tuning. arXiv:2304.08485.
  29. Lopez-Lira, A. and Tang, Y. (2023). Can ChatGPT Forecast Stock Price Movements? arXiv:2304.07619.
  30. Louppe, G. (2015). Understanding Random Forests. arXiv:1407.7502.
  31. Mai, D. (2024). StockGPT. arXiv:2404.05101.
  32. Mehandru, N. et al. (2024). Evaluating large language models as agents in the clinic. npj Digital Medicine 7.
  33. Mezrich, B. (2021). The Antisocial Network. Grand Central Publishing.
  34. Mnih, V. et al. (2013). Playing Atari with Deep Reinforcement Learning. arXiv:1312.5602.
  35. OpenAI (2023). GPT-4V(ision) System Card.
  36. OpenAI (2024). GPT-4 Technical Report. arXiv:2303.08774.
  37. Ouyang, L. et al. (2022). Training language models to follow instructions with human feedback. arXiv:2203.02155.
  38. Park, J. S. et al. (2023). Generative Agents. arXiv:2304.03442.
  39. Park, J. S. et al. (2023). Generative Agents (same as [38]).
  40. Sarkar, A. et al. (2023). Evaluating Impact of Social Media Posts by Executives on Stock Prices. FIRE ’22.
  41. Scheurer, J., Balesni, M. and Hobbhahn, M. (2024). LLMs can Strategically Deceive their Users when Put Under Pressure. ICLR 2024 Workshop on LLM Agents.
  42. Schulhoff, S. et al. (2024). The Prompt Report. arXiv:2406.06608.
  43. Schulman, J. et al. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347.
  44. Sharpe, W. F. (1966). Mutual Fund Performance. The Journal of Business 39(1).
  45. S&P Dow Jones Indices (2024). S&P 500 Index.
  46. Wang, L. et al. (2024). A survey on large language model based autonomous agents. Frontiers of Computer Science 18(6).
  47. Wang, M., Izumi, K. and Sakaji, H. (2024). LLMFactor. arXiv:2406.10811.
  48. Wang, S. et al. (2024). QuantAgent. arXiv:2402.03755.
  49. Wang, S. et al. (2023). Alpha-GPT: Human-AI interactive alpha mining. arXiv:2308.00016.
  50. Wu, R. (2024). Portfolio Performance Based on LLM News Scores. SSRN 4709617.
  51. Xing, F. (2024). Designing Heterogeneous LLM Agents for Financial Sentiment Analysis. arXiv:2401.05799.
  52. Yang, A. et al. (2023). Baichuan 2. arXiv:2309.10305.
  53. Yu, Y. et al. (2023). FinMem. arXiv:2311.13743.
  54. Zhang, C. et al. (2024). When AI Meets Finance (StockAgent).
  55. Zhang, F., Guo, R. and Cao, H. (2020). Information Coefficient as a Performance Measure of Stock Selection Models. arXiv:2010.08601.
  56. Zhang, H. et al. (2024). Unveiling the Potential of Sentiment. arXiv:2306.14222.
  57. Zhang, W. et al. (2024). A Multimodal Foundation Agent for Financial Trading. arXiv:2402.18485.
  58. Zhang, X., Fuehres, H. and Gloor, P. A. (2011). Predicting Stock Market Indicators Through Twitter. Procedia — Social and Behavioral Sciences 26.
  59. Zhang, Z. et al. (2024). Simulating Classroom Education with LLM-Empowered Agents. arXiv:2406.19226.
  60. Zheng, Q. (2024). How can we use ChatGPT better. M.A. Thesis, University of Chicago.

Перевод основного текста. Оригинал: arXiv:2408.06361 · Ding, Li, Wang, Chen, Guo, Zhang · CC BY 4.0.