Проблема запоминания: можно ли доверять экономическим прогнозам LLM?
Алехандро Лопес-Лира, Юэхуа Тан, Минъинь Чжу · University of Florida · первая версия: 15 апреля 2025; текущая версия: 16 декабря 2025
Оригинал: Lopez-Lira, A., Tang, Y., Zhu, M. «The Memorization Problem: Can We Trust LLMs' Economic Forecasts?», 2025 — arxiv.org/abs/2504.14765 (PDF).
Рисунки воспроизведены из оригинальной публикации; тексты промптов и примеры анонимизированных документов сохранены на английском, поскольку это дословные входы и выходы моделей. Оригинал распространяется по лицензии CC BY-NC-ND 4.0; перевод выполнен в ознакомительных целях с указанием источника.
Аннотация
Большим языковым моделям (LLM) нельзя доверять в экономических прогнозах на периодах, покрытых их обучающими данными. Контрфактическая прогнозная способность неидентифицируема, когда модель видела реализованные значения: любой наблюдаемый выход согласуется и с подлинным навыком, и с запоминанием. Любое свидетельство запоминания — лишь нижняя граница закодированного знания. Мы демонстрируем, что LLM запомнили экономические и финансовые данные и воспроизводят точные значения до своей даты отсечки знаний. Инструкции соблюдать исторические границы не мешают достигать точности уровня воспроизведения, а маскирование не защищает: LLM реконструируют сущности и даты из минимального контекста. После отсечки воспроизведения не наблюдается. Запоминание распространяется и на эмбеддинги.
Ключевые слова: большие языковые модели, ChatGPT, запоминание, lookahead-смещение, экономическое прогнозирование, текстовый анализ, эмбеддинги. Классификация JEL: C53, C58, E37, G10, G17.
1. Введение
Растущий корпус литературы применяет большие языковые модели (LLM) для генерации исторических ожиданий, оценки их прогнозной точности или бэктестирования инвестиционных стратегий на основе LLM внутри периодов, покрытых обучающими данными этих моделей. Большинство LLM обучены на всеобъемлющих датасетах интернет-масштаба вплоть до конкретной даты отсечки знаний, что создаёт фундаментальную проблему: анализируя данные до отсечки, мы не можем различить, демонстрирует ли модель подлинную прогнозную способность или просто воспроизводит запомненную информацию.1 Например, если LLM запомнили исторические значения S&P 500, оценка их способности «прогнозировать» эти значения из любой информации до отсечки становится ненадёжной. В этой статье мы показываем, что LLM запомнили большие объёмы экономических и финансовых данных, что ставит под сомнение обычную интерпретацию прогнозной способности LLM.
Теоретически мы формализуем проблему запоминания как проблему неидентифицируемости и доказываем: когда модель видела реализованные значения во время обучения, её контрфактическую прогнозную способность нельзя восстановить из её выходов. Любой наблюдаемый прогноз согласуется с двумя противоречащими объяснениями (подлинный аналитический навык или простое воспроизведение запомненной информации), делая статистический вывод невозможным. Эмпирически мы показываем, что эта проблема действует на практике, предоставляя систематические свидетельства масштабного запоминания LLM экономических и финансовых данных. Вместе эти результаты устанавливают, что исследования «прогнозирования» до отсечки сталкиваются с фундаментальной методологической проблемой: они не могут отличить подлинную предсказательную способность от запоминания. Ограничивающие промпты (например, «используй только данные до 2010 года») не могут это разрешить, потому что промпты не меняют информацию, закодированную в параметрах модели.
Наши теоретические результаты доказывают, что и другие часто предлагаемые решения не работают. Во-первых, дообучение модели «забыть» будущую информацию не помогает: не исследуя, что фактически удалено из модели, мы не можем сказать, действительно ли модель забыла или лишь научилась скрывать то, что знает. Во-вторых, использование малых выборок после отсечки в качестве «проверок устойчивости» невалидно: когда эти выборки малы, подлинный прогнозный навык и необнаруженное запоминание дают статистически неразличимые результаты. Наконец, любое свидетельство запоминания — лишь нижняя граница: то, что один тест не смог извлечь запомненное знание, не означает его отсутствия, поскольку другие промпты или контекстные подсказки могут его активировать.
С помощью нового тестового каркаса мы показываем, что LLM способны воспроизводить точные числовые значения экономических данных из своего обучения. Например, до своей даты отсечки знаний (октябрь 2023) GPT-4o может воспроизводить конкретные уровни индекса S&P 500 с идеальной точностью на определённые даты, уровни безработицы с точностью до десятой процентного пункта и точные квартальные темпы роста ВВП. Рисунок 1 показывает запомненные моделью значения трёх фондовых индексов (S&P 500, Dow Jones Industrial Average и Nasdaq Composite) вместе с фактическими значениями и соответствующими ошибками. Помимо американских и международных макроиндикаторов и рыночных индексов, мы находим ясные свидетельства запоминания цен отдельных бумаг — более выраженного для заметных акций и в недавние периоды. Модель также демонстрирует почти идеальную идентификацию дат заголовков первых полос главных СМИ. Короче говоря, мы документируем повсеместное запоминание.
Рисунок недоступен для встраивания — смотреть в оригинале
Далее мы демонстрируем, что стандартные техники ограничения знаний модели не мешают доступу к запомненным данным. Когда мы инструктируем GPT-4o игнорировать любую информацию после 2010 года при прогнозе направления квартального роста ВВП, модель достигает пороговой точности 97.6% до искусственной отсечки и 98.0% после — почти одинаковый результат вопреки явному ограничению.2 Для сравнения, фактическая точность после настоящей отсечки знаний — лишь 40%. Эти результаты говорят, что ограничения на уровне промпта на практике не работают. Но даже если бы ограниченные промпты давали более низкую точность, теория объясняет, почему и этот результат был бы столь же неинформативен: прогнозная способность не идентифицируется — результат согласуется и с тем, что модель запомнила исход и отыгрывает роль худшего прогнозиста, и с тем, что она действительно способна забыть исходную информацию.
Чтобы понять, какие приложения уязвимы, нужно отличать задачи, где знание будущего влияет на ответ, от задач, где не влияет. Проблема запоминания касается всех задач, не являющихся будуще-инвариантными: задач, где ответ аналитика отличался бы при знании будущих исходов. Простые задачи извлечения, где правильный ответ одинаков независимо от знания будущего (например, извлечение имён сущностей или объективных числовых фактов), обычно не затронуты. Однако многие задачи, выглядящие как чистое извлечение, на деле нагружены суждением: оценка «релевантности» или «важности», выявление «рисков», классификация «тональности», генерация «ожиданий» — всё это интерпретации, на которые может влиять знание последующих исходов. Для таких задач параметры модели кодируют будущую информацию, несмотря на входы до отсечки: lookahead-смещение в функции, а не в данных. Раздел 2 формализует это различие и даёт конкретные рекомендации по типовым категориям задач.
Техники маскирования (анонимизация имён сущностей, компаний или дат) дают более тонкую картину. В теории валидное маскирование требует двух условий: будущей инвариантности (замаскированная задача не зависит от информации после отсечки) и обнаружимого навыка (модель показывает статистически значимую результативность). Когда оба условия выполнены, маскирование допускает либо использование с сохранением задачи (восстановление исходной цели оценивания), либо использование для демонстрации способности (установление подлинной способности модели на другом классе задач). Без обнаружимого навыка слабая результативность создаёт ещё одну проблему идентификации: мы не можем отличить отсутствие способности от чрезмерно агрессивного маскирования, удалившего необходимую информацию.
На практике попытки помешать LLM обращаться к будущей информации через маскирование сталкиваются со значительными трудностями. Мы показываем, что LLM способны реконструировать исходные сущности из, казалось бы, минимальных контекстных подсказок в сложных финансовых документах. Например, рисунок 2 показывает: когда мы предъявляем GPT-4o анонимизированную стенограмму отчётного звонка Ethan Allen (ETH), где названия компаний, числа, локации и даты замаскированы методом «нейтрализации сущностей» (entity neutering) из Engelberg et al. (2025), модель всё равно правильно идентифицирует компанию (ETH), квартал (Q1) и год (2018). Стенограмма содержала лишь общие деловые формулировки вроде «Our adjusted EPS of number e increased number f percent from the prior year», и тем не менее модель восстанавливает точную корпоративную идентичность и отчётный период.
Анонимизированный фрагмент отчётного звонка:
Thank you, name x, and welcome to our earnings call.
Our time x sales were up number a%. They would have been higher, but due to bottlenecks on production and delay in shipments. We ended with wholesale backlogs increasing number b% and Retail Division backlogs increasing number c%. Several factors impacted our production, gross margins, and shipments. We processed a large location x order of mostly new product to be delivered in number d days as per contract. Although a significant portion that was produced had to be held up for shipment until our time x at their request. We were also affected by political events in location x this time x. These events are now resolved and production has resumed.
Our adjusted EPS of number e increased number f% from the prior year, helped by change in the tax laws.
While we maintained a strong operating margin of number g%, we had the opportunity to have higher margins with more delivered sales.
While we are making good progress expanding our business with the location x, worldwide product type x program and our contract division and internationally, we need to increase written business in our location x retail network.
With many already initiatives underway, including continuing to develop a strong talented team, strengthening our offerings and the projections and the locations of our design centers and improvements in our production capabilities, we plan to substantially increase our marketing efforts in the time x.
We expect to increase our advertising expenditures by number h% in the time x and number i% in the time x from higher levels spent last year in the time x and time x.
After name x gives a brief overview, I will discuss our initiatives in greater detail.
Ответ GPT-4o: Ticker: ETH Quarter: Q1 Year: 2018
Систематически анализируя анонимизированные стенограммы отчётных звонков, мы находим, что GPT-4o правильно идентифицирует компанию в 100% звонков Apple, Meta и Microsoft и более чем в 85% звонков для всех фирм «Великолепной семёрки».3 Для Apple модель достигает точности 93.2% в определении правильного квартала и года. Успешная реконструкция доказывает, что замаскированная задача не является будуще-инвариантной — модель по-прежнему может обращаться к контекстным знаниям об этих сущностях. Более того, даже когда реконструкция не удаётся, модель может обращаться к запомненному знанию через непроверенные агрегированные каналы (например, отраслевые паттерны, деловую конъюнктуру, макроэкономический контекст). Короче говоря, тесты на реконструкцию прощупывают лишь конечное множество путей; неудача реконструкции не доказывает, что будущая инвариантность выполняется.
Далее, запоминание не ограничено задачами на промптах: признаки его несут даже векторы эмбеддингов.4 Мы тестируем запоминание, кодируя текстовые промпты, в которых опущено конкретное числовое значение для заданной даты (например, «In Q4 2020, the earliest estimate of the US GDP growth rate was»), вычисляя их эмбеддинги и регрессируя макроэкономические исходы на эти эмбеддинги. При нулевой гипотезе отсутствия запоминания эти эмбеддинги не должны обладать предсказательной силой; вместо этого мы находим свидетельства предсказательного содержания для таких переменных, как инфляция и уровень безработицы.
Учитывая эти трудности методов, пытающихся обойти запоминание, надёжная оценка подлинных прогнозных способностей LLM возможна только на данных после их дат отсечки знаний. Один подход — применять модели, явно спроектированные с временными отсечками (например, Sarkar 2024; Rahimikia, Drinkall 2024; He et al. 2025). Другой — ограничивать анализ исключительно периодом после отсечки знаний (например, Lopez-Lira, Tang 2023; Pham, Cunningham 2024; Bozman, Fairhurst, Greene 2025). Только тестируя предсказания для периодов, которым модели не были экспонированы при обучении, можно уверенно отличить подлинную прогнозную способность от запоминания.
Как минимум мы рекомендуем использовать нашу методологию, чтобы проверять, запомнила ли модель информацию в каждой исследовательской постановке. Всякий раз, когда выход LLM отличался бы при знании будущего, применять её к данным внутри периода обучения по сути рискованно.
Связанная литература и вклад. Мы вносим вклад в литературу о пределах LLM в экономике и финансах через теоретические и эмпирические продвижения. Теоретически мы доказываем: когда модели запомнили исходы, прогнозная способность неидентифицируема. Эмпирически мы демонстрируем, что LLM проявляют систематическое запоминание экономических и финансовых данных в масштабе. Наш ключевой методологический вклад — тестовый каркас, выявляющий то, что упускают косвенные тесты, и дающий недвусмысленные свидетельства запоминания.
Предыдущие исследования опирались на изобретательные контекст-специфичные эксперименты для выявления lookahead-смещения. Sarkar и Vafa (2024) используют появление COVID-19 в допандемийных факторах риска фирм как свидетельство того, что модели Llama непреднамеренно включают будущую информацию. Хотя такие естественные эксперименты ценны, они требуют конкретных исторических событий и не могут раскрыть полный масштаб проблемы. Levy (2024) находит, что GPT-4o плохо справляется с числовыми задачами и что возмущение финансовой отчётности роняет предсказательную точность LLM до случайного уровня, и высказывает гипотезу, что LLM запоминают.5 В отличие от этих работ, наш метод универсально применим: напрямую извлекая числовые значения, используя лишь названия переменных и даты, любой исследователь может проверить любой экономический ряд на запоминание без изобретательных дизайнов. Более того, наш метод демонстрирует, как запоминание затрагивает и подходы на основе эмбеддингов.
Параллельная работа Ludwig, Mullainathan и Rambachan (2025) развивает эконометрический каркас использования LLM и выделяет «утечку обучения» (training leakage — попадание конкретных текстов из выборки исследователя в обучающие данные модели) как угрозу валидному выводу. Мы адресуем более фундаментальную проблему: функциональное lookahead-смещение, когда параметры модели кодируют информацию после момента $t$, выученную из агрегированного обучающего корпуса, тем самым загрязняя решающее правило, даже если конкретный входной текст никогда не встречался в обучении. Мы доказываем, что целевой эстиманд неидентифицируем из-за наблюдательной эквивалентности (предложение 1, следствие 1), а распространённые средства доказуемо не работают (следствие 2, предложение 2). Эмпирически мы даём систематические свидетельства того, что модели запомнили исходы и фундаментальные показатели в масштабе для экономических и финансовых данных, и разрабатываем каркас прямого извлечения для проверки того, какая информация закодирована в параметрах модели.
Исследования сосредоточивались и на потенциальных решениях. Sarkar (2024), Rahimikia и Drinkall (2024) и He et al. (2025) обучают хронологически согласованные языковые модели, полностью избегающие lookahead-смещения за счёт обучения различных чекпойнтов на темпорально упорядоченном датасете. Engelberg et al. (2025) предлагают «нейтрализацию сущностей» — использование LLM для удаления идентифицирующей информации из текста — и находят, что замаскированный текст сохраняет ту же тональность и предсказуемость доходностей, что и незамаскированный. Родственно, Glasserman и Lin (2023) находят, что прогнозирование по анонимизированным заголовкам превосходит оригиналы внутри окна обучения — то есть эффект отвлечения от общих знаний о компании (в случае анонимизированных заголовков), по-видимому, перевешивает lookahead-смещение. Наконец, другие исследователи ограничивались исключительно периодом после отсечки знаний во избежание lookahead-смещения (например, Lopez-Lira, Tang 2023; Pham, Cunningham 2024; Bozman, Fairhurst, Greene 2025), эксплуатируя то, что у старых версий GPT-3.5 и GPT-4 дата отсечки — сентябрь 2021.
ChatGPT и другие LLM в последнее время использовались для прогнозирования или извлечения ожиданий по разнообразным экономическим рядам, включающим период обучения LLM, путём опроса модели (например, J. Chen et al. 2023; Bond, Klok, Zhu 2024; Tan, Wu, Zhang 2024; Jha et al. 2025; Degen et al. 2024). Наши результаты предполагают осторожность при интерпретации части этих выводов: видимая прогнозная точность может отражать запоминание моделью обучающих данных, а не подлинную предсказательную способность. Более того, исследования, находящие неточности или смещения в предсказаниях LLM в течение их периода обучения, могут измерять не фактические ограничения прогнозирования, а случаи, когда модель пытается дать полезный ответ, притворяясь, что не знает информацию, которую запомнила.
С ростом числа применений LLM в исследованиях по экономике и финансам (например, Jha et al. 2024; Cao et al. 2025; van Binsbergen, Han, Lopez-Lira 2022; Bai et al. 2023; Chen, Kelly, Xiu 2022; Kim, Muhn, Nikolaev 2024; Beckmann et al. 2024; Breitung, Müller 2025; Bybee 2023; Horton 2023; Hansen et al. 2024; Manning, Zhu, Horton 2024; Clayton et al. 2025) требуется больше работы по оценке того, в какой мере запоминание LLM может влиять на конкретные приложения — сопоставление по сходству, оценку тональности, генерацию опросов и извлечение ожиданий.
2. Формализация проблемы запоминания
Эконометрически проблема состоит в несоответствии информационных множеств и параметров. Исследователь хочет оценивать решения, используя только то, что было известно в момент $t$, но параметры модели уже кодируют информацию, раскрытую после $t$. Этот раздел даёт интуицию в упрощённых обозначениях; формальные определения, предположения и доказательства — в приложении C.
2.1. Lookahead-смещение в прогнозировании LLM
Постановка. Пусть $I_t$ — информация, доступная в момент $t$, а $I_{>t}$ — информация, раскрытая позже; $I_{\mathrm{all}} = I_t \cup I_{>t}$. Пусть $Q_t$ — задача, поставленная «по состоянию на $t$» (включающая инструкцию и любые входные данные из $I_t$). Пусть $Y_{\mathrm{true}}$ — реализованный исход (раскрытый после момента $t$). Пусть $\theta = \theta(I_{\mathrm{all}})$ — фактические параметры полностью обученной модели (обученной на всех данных), а $S_\phi(\cdot)$ — внутренняя оценочная функция модели, где $\phi$ обозначает произвольные параметры модели. Определим $\theta_t = \theta(I_t)$ как контрфактические параметры, которые получились бы при применении той же процедуры обучения к ограниченному информационному множеству $I_t$. Мы моделируем выход LLM как оптимальное решение $y$ из множества возможных ответов $\mathcal{Y}$, выбираемое решающим правилом $\delta_\phi(Q, P) := \operatorname{argmax}_{y \in \mathcal{Y}} S_\phi(y; Q, P)$, где $Q$ — задача, а $P$ — дополнительные инструкции, модифицирующие задачу ($P = \varnothing$ обозначает отсутствие дополнительных инструкций сверх самой задачи).6
Идеал (целевой эстиманд). Контрфактическое решение, которое хочет получить исследователь:
\[ Y_t^\star := \delta_{\theta_t}(Q_t, \varnothing) = \operatorname*{argmax}_{y \in \mathcal{Y}} S_{\theta_t}\big(y;\, Q_t, \varnothing\big). \tag{1}\]Наблюдаемое (реализуемый эстиманд). На практике мы наблюдаем решение полностью обученной модели:
\[ Y_{\mathrm{LLM}} = \delta_{\theta}(Q_t, \varnothing) = \operatorname*{argmax}_{y \in \mathcal{Y}} S_{\theta}\big(y;\, Q_t, \varnothing\big), \qquad \theta = \theta(I_{\mathrm{all}}). \tag{2}\]Определение 1 (инвариантность задачи и lookahead-смещение). Задача $Q_t$ является либо:
- Будуще-вариантной: задача будуще-вариантна (эквивалентно — проявляет lookahead-смещение), если решение LLM зависит от информации после $t$, встроенной в параметры: \[ \delta_{\theta_t}(Q_t, \varnothing) \ne \delta_{\theta}(Q_t, \varnothing), \tag{3}\] то есть контрфактический ответ (что модель предсказала бы, будучи обученной только на информации до $t$) отличается от ответа полностью обученной модели. Определение задано относительно модели: предполагается, что процедура обучения детерминирована при условии данных, так что единственное различие между $\theta$ и $\theta_t$ — включение будущей информации $I_{>t}$.
- Будуще-инвариантной: задача будуще-инвариантна, если идентичность оптимального ответа инвариантна к информации после $t$: \[ \delta_{\theta_t}(Q_t, \varnothing) = \delta_{\theta}(Q_t, \varnothing), \tag{4}\] то есть обучение на полном информационном множестве $I_{\mathrm{all}}$ и на ограниченном $I_t$ даёт один и тот же ответ.
Поскольку параметры модели кодируют информацию из полных обучающих данных, иные применения этих параметров (например, векторы эмбеддингов) также могут отражать запомненную информацию.
Lookahead-смещение повсеместно и затрагивает задачи, требующие суждения, выбора или предсказания. Оно загрязняет любую задачу, не являющуюся будуще-инвариантной. Например, классификация тональности статьи 2007 года о рынке жилья: при $\theta_t$ оптимальным по оценочной функции может быть ответ «оптимистично»; при $\theta$ (включающей кризис 2008 года) оптимальным может стать «негативно». Это отличается от стандартного lookahead-смещения данных в эконометрике (например, случайного включения данных Q4 в предиктивную регрессию Q3): вход $Q_t$ здесь валиден и содержит только информацию, доступную в момент $t$, но обрабатывающая его функция $\delta_\theta$ загрязнена будущей информацией, встроенной в параметры модели (lookahead-смещение функциональной формы).
Практическое руководство для исследователей. Чтобы применять это различие на практике, исследователь может оценить будущую инвариантность задачи вопросом: изменился бы ответ аналитика, знай он, что произошло после момента $t$? Если да — или даже правдоподобно да, — задача не будуще-инвариантна. При восстановлении ответов о конкретных фирмах, событиях или периодах использование выходов LLM на данных до отсечки проблематично.
Типовые категории задач.
Вероятно будуще-инвариантные (безопасны для использования до отсечки):
- фактологическое извлечение: имена сущностей, даты, отчётные числа;
- структурный парсинг: подсчёт слов, границы предложений, структура документа;
- объективная классификация: определение языка, частеречная разметка.
Не будуще-инвариантные:
- оценка на основе суждений: выявление «важной» или «релевантной» информации;
- анализ тональности и тона: оценка позитивности или негативности текста;
- риск и неопределённость: извлечение «рисков», «опасений», «неопределённостей»;
- прогнозирование и ожидания: генерация предсказаний или извлечение ожиданий;
- сходство и сравнение: определение, какие документы «похожи» экономически осмысленным образом.
Для будуще-вариантных задач второй категории использование до отсечки невалидно. Независимо от типа задачи исследователям следует проверять, что модель запомнила, нашей процедурой прямого извлечения (см. раздел 3). Даже кажущиеся безопасными задачи фактологического извлечения могут быть загрязнены, если модель запомнила конкретные факты, значимые для анализа. Например, задача «извлеки все риски, упомянутые в этом отчётном звонке 2007 года» не будуще-инвариантна, хотя выглядит простым извлечением. Понятие «риска» нагружено суждением: то, какие риски модель сочтёт заметными, информировано знанием, какие из опасений действительно материализовались в проблемы.
Замечание 1 (свойство нижней границы у тестов запоминания). Любой тест запоминания устанавливает лишь нижнюю границу закодированного в $\theta$: положительное свидетельство заключительно, отрицательное — нет.
Разные пары «запрос–промпт» могут обращаться к разным подмножествам закодированной информации через разные механизмы, поэтому неспособность извлечь знание в конкретном тесте не доказывает его отсутствия. Следовательно, обусловливание на случаях, где тесты не срабатывают (например, ограничение наблюдениями, где модель не может идентифицировать фирму), не разрешает неидентифицируемость — модель по-прежнему может обращаться к запомненной информации через альтернативные контекстные подсказки.
2.2. Неидентифицируемость ограниченных прогнозов
Исследователи иногда добавляют ограничивающие промпты $P$ (например, «используй только данные до 2010 года»), надеясь эмулировать $Y_t^\star$ без переобучения модели. Для любого такого промпта определим ограниченный выход как
\[ Y_{\mathrm{constrained}}(P) := \delta_{\theta}(Q_t, P) = \operatorname*{argmax}_{y \in \mathcal{Y}} S_{\theta}\big(y;\, Q_t, P\big), \qquad \theta = \theta(I_{\mathrm{all}}). \tag{5}\]Цель исследователя — использовать наблюдаемое $Y_{\mathrm{constrained}}(P)$ как прокси ненаблюдаемого идеального эстиманда $Y_t^\star$. Центральный методологический вопрос — можно ли однозначно восстановить $Y_t^\star$ из ограниченных выходов. Это формальный вопрос идентификации. Следующее предложение утверждает, что это невозможно.
Предложение 1 (неидентифицируемость). Даны наблюдения $Y_{\mathrm{constrained}}(P)$ для любого множества ограничивающих промптов $\{P_k\}$, призванных ограничить модель информацией, доступной в момент $t$. Тогда идеальный эстиманд $Y_t^\star$ не может быть однозначно идентифицирован. Любой наблюдаемый ограниченный выход согласуется с множественными, противоречащими друг другу значениями истинного контрфактического прогноза $Y_t^\star$.
Проблема — в наблюдательной эквивалентности: любой наблюдаемый выход согласуется и с тем, что ограничение сработало (модель действительно прогнозирует, используя только информацию до $t$), и с тем, что ограничение не сработало (модель достаёт запомненный ответ). Без дополнительных предположений эти альтернативы неразличимы. Формальную конструкцию см. в приложении C.
Следствие 1 (резкая неидентифицируемость). При тех же условиях, что и в предложении 1, для любого наблюдаемого ограниченного выхода идентифицированное множество для $Y_t^\star$ равно всему множеству меток $\mathcal{Y}$. То есть наблюдение ограниченных выходов даёт нулевую информацию об идеальном эстиманде.
(Доказательство см. в приложении C.)
Для иллюстрации практических следствий рассмотрим реализованный исход, раскрывшийся со временем после момента $t$. Пусть $Y_{\mathrm{true}} \in \mathcal{Y}$ — этот истинный исход. Контринтуитивно, и хорошие, и плохие прогнозы неинтерпретируемы из-за точной наблюдательной эквивалентности. «Хороший» прогноз ($Y_{\mathrm{constrained}} = Y_{\mathrm{true}}$) может означать, что ограничение сработало и модель показала подлинный навык, — или что ограничение не сработало и модель просто вспомнила запомненный ответ. «Плохой» прогноз ($Y_{\mathrm{constrained}} \ne Y_{\mathrm{true}}$) столь же неинформативен: ограничение могло сработать, дав подлинный, но неверный прогноз ($Y_t^\star = Y_{\mathrm{constrained}}$), — или модель использует информацию после $t$ непредусмотренным образом (например, опираясь на запомненное знание того, как выглядели исторические прогнозы или убеждения, чтобы симулировать ответ, уместный для эпохи). Как показывают наши эмпирические тесты, неправдоподобно высокая точность по многим позициям говорит, что ограничения обычно не срабатывают. Следовательно, ограниченные промпты делают прогнозы фундаментально неинформативными о целевом эстиманде.
Следствие 2 (чёрный ящик дообучения). Тот же результат неидентифицируемости справедлив для дообучения «чёрным ящиком» с целью «забыть» информацию после $t$: без верификации «белым ящиком» $Y_t^\star$ нельзя идентифицировать из выходов дообученной модели.
Проблема — наблюдательная эквивалентность между подлинным забыванием (параметры изменены так, чтобы приблизить $\theta_t$) и поведенческим подавлением (информация после $t$ по-прежнему встроена, но модель научилась её скрывать). Формальную конструкцию см. в приложении C.
2.3. Маскирование как потенциальное решение
Процедуры маскирования пытаются удалить идентифицирующую информацию (названия фирм, даты, отраслевые метки) из задач в надежде помешать модели обращаться к запомненной информации, сохранив при этом способность к полезному анализу.
Определение 2 (валидное маскирование). Пусть $M : Q_t \mapsto Q_t^{\mathrm{mask}}$ — процедура маскирования. Маскирование валидно, если:
- Будущая инвариантность: $\delta_{\theta_t}(Q_t^{\mathrm{mask}}, \varnothing) = \delta_{\theta}(Q_t^{\mathrm{mask}}, \varnothing)$.
- Обнаружимый навык: точность модели на замаскированных данных до отсечки превышает бейзлайн ($p_{\mathrm{mask}} > p_0$).
Условие (ii) необходимо для идентификации: без него слабая результативность может отражать либо отсутствие способности, либо чрезмерно агрессивное маскирование — наблюдательно эквивалентные альтернативы, аналогичные предложению 1. Валидное маскирование допускает два исследовательских применения: с сохранением задачи (если $\delta_{\theta}(Q_t^{\mathrm{mask}}, \varnothing) = Y_t^\star$ — восстановление исходного эстиманда) или для демонстрации способности (если эстиманд меняется — установление способности на классе замаскированных задач).
Замечание 2 (тесты реконструкции и свойство нижней границы). По замечанию 1 тесты реконструкции дают асимметричные свидетельства: успешная реконструкция доказывает, что условие (i) нарушено, но неудача реконструкции не доказывает, что оно выполняется.
Верификация условия (i) требует и эмпирических свидетельств (реконструкция не удаётся), и теоретических аргументов (не существует информационного пути) — аналогично установлению экзогенности инструментальной переменной в эконометрике. Когда маскирование сохраняет будущую инвариантность, оно допускает использование с сохранением задачи (восстановление исходного эстиманда); когда оно меняет эстиманд, но поддерживает будущую инвариантность, — использование для демонстрации способности. Подробности см. в приложении C.
2.4. Данные после отсечки и проблема идентификации
Данные после отсечки дают потенциальное решение предложения 1: поскольку модель не обучалась на этих данных, точность после отсечки напрямую измеряет прогнозную способность. Однако распространённая практика — сообщать точность до отсечки как основной результат, а малые выборки после отсечки использовать как «проверки устойчивости», утверждая, что схожая точность означает отсутствие запоминания. Следующее предложение показывает, почему эта практика необоснованна.
Предложение 2 (статистическая неразличимость в сравнениях до/после отсечки). Когда размер выборки после отсечки мал относительно размера выборки до отсечки, подлинный прогнозный навык и необнаруженное запоминание не могут быть надёжно различены тестами гипотез. Экономически существенные разрывы запоминания остаются статистически необнаружимыми из-за низкой мощности.
Следовательно, если данные после отсечки достаточны, чтобы быть информативными, они должны быть основным анализом, а не проверкой устойчивости; если недостаточны — сравнение точности до и после отсечки не способно отличить навык от запоминания. Формальный анализ мощности см. в приложении C.
3. Методология
Для оценки запоминания LLM экономических и финансовых данных мы разрабатываем тестовый каркас, изолирующий способность к воспроизведению от прогнозирования. Наш подход формализует информационную среду, предоставляя контекстное множество $x_t$ и запрашивая предсказание о $y_{t+1}$, где $t$ — конкретный момент времени. Структура запроса явно ссылается на периоды, прося модель предоставить экономические или финансовые данные на конкретные даты. Например, мы можем спросить: «Каким был уровень S&P 500 2 мая 2020 года?»
Мы варьируем информационное множество $x_t$, чтобы изолировать разные механизмы доступа к памяти. В базовом случае мы не даём контекста, тестируя чистое воспроизведение. Затем мы дополняем его двумя всё более богатыми информационными средами: (1) исторический контекст с недавней историей $y_t$ до момента $t$ и (2) новостной контекст с заголовками ведущих финансовых изданий за период перед $t$.
Наши тесты способностей LLM к воспроизведению охватывают несколько категорий экономических переменных. Во-первых, мы тестируем макроэкономические индикаторы, запрашивая точные значения (например, уровни безработицы) и направленные тренды. Во-вторых, мы исследуем фондовые индексы через вопросы о точных числовых уровнях, направленных изменениях, процентных движениях и относительной результативности. Например, мы спрашиваем значение закрытия S&P 500 на конкретные даты или вырос либо упал NASDAQ в конкретные дни. В-третьих, мы тестируем способность LLM определять даты новостных заголовков, предъявляя наборы заголовков первой полосы The Wall Street Journal без дат и прося определить, когда эти заголовки появились, и предсказать соответствующий уровень S&P 500 на следующий торговый день. В-четвёртых, мы оцениваем способность воспроизводить информацию по отдельным бумагам, включая конкретные уровни цен акций и направленные движения. В-пятых, мы исследуем эффективность просьб к LLM наложить искусственные даты отсечки знаний. Наконец, мы тестируем способность LLM восстанавливать идентичность компаний из анонимизированных фирменных текстов, включая отчётные звонки и новостные заголовки.
3.1. Выбор периодов и дополнительный анализ
Наш экспериментальный дизайн стратегически охватывает три временные зоны относительно даты отсечки обучения LLM. Во-первых, мы включаем периоды до отсечки, где при наличии запоминания ожидаем высокую точность воспроизведения. Во-вторых, мы исследуем периоды в пределах 10 лет перед отсечкой, чтобы оценить возможные эффекты недавности в паттернах запоминания. Наконец, мы включаем периоды после отсечки как контрольное условие, где запоминание не ожидается.
3.2. Промпт
Мы применяем стандартизированный шаблон промпта во всех запросах к моделям для обеспечения согласованности и минимизации экспериментальной вариации. Каждый промпт включает опциональную контекстную секцию, конкретный вопрос об экономических данных и явные инструкции по форматированию ответа. Общий шаблон:
[Context: {context information}]
{question about economic data}
Provide a precise answer based on your knowledge. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise answer to the question.
- confidence: A number between 0 and 100 indicating the model's confidence in its answer.
Контекстная информация представляет информационное множество $x_t$ наших экспериментальных условий; она может быть пустой (при тестировании чистого воспроизведения), содержать исторические точки данных, включать релевантные новостные заголовки или давать общие знания о периоде. Более детальная информация — в разделе A приложения.
Например, в промпте, тестирующем воспроизведение с историческим контекстом, мы можем предоставить: «Context: The S&P 500 closed at 2,834.40 on March 14, 2019, and at 2,808.48 on March 13, 2019. What was the S&P 500 closing value on March 15, 2019?» Этот стандартизированный подход позволяет систематически варьировать предоставляемую информацию, контролируя смешивающие факторы в формулировке вопроса или ожиданиях ответа.
3.3. LLM
Учитывая широкое использование в исследованиях, основной анализ мы проводим на ChatGPT-4o, конкретная версия — «gpt-4o-2024-08-06». Эта модель — снапшот GPT-4o, обеспечивающий согласованные результативность и поведение. Она не будет получать обновления, а её обучающие данные заканчиваются октябрём 2023.7 Важно, что температура модели установлена в 0 для всех анализов, чтобы максимизировать воспроизводимость результатов.8 В дополнительных анализах мы также тестируем способности к воспроизведению у open-source моделей, таких как Llama-3.1-70b-Instruct.9
4. Данные
Большинство тестов используют данные с января 1990 по сентябрь 2023, то есть до даты отсечки знаний GPT-4o (октябрь 2023). Для проверки запоминания LLM мы используем три категории датасетов: (1) фондовые индексы и цены отдельных акций, (2) макроэкономические индикаторы, (3) текстовые данные — новости первой полосы WSJ, отчётные звонки и фирменные новостные заголовки.
Мы просим LLM дать значение закрытия фондовых индексов и выборки отдельных акций. Для оценки ответов LLM используем дневные закрытия S&P 500, Dow Jones Industrial Average и Nasdaq Composite из Yahoo Finance. Данные Center for Research in Security Prices (CRSP) используем для получения дневных цен закрытия отдельных акций. Выборка отдельных акций включает «Великолепную семёрку» (AAPL, AMZN, GOOGL, META, MSFT, NVDA, TSLA) и случайно отобранные подвыборки акций разных категорий размера — всего более 4 200 уникальных тикеров.
Мы также просим LLM дать оценки различных макроэкономических индикаторов. Тестируемые индикаторы: (i) рост ВВП США, (ii) инфляция, (iii) уровень безработицы, (iv) доходность 10-летних трежерис, (v) VIX, (vi) закладки новых домов (housing starts), (vii) изменение занятости вне сельского хозяйства (nonfarm payrolls). Фактические значения уровня безработицы и доходности 10-летних трежерис берём из Federal Reserve Economic Data (FRED). Уровни VIX — из Yahoo Finance. Для роста ВВП, инфляции, закладок домов и изменения занятости используем Real-Time Data Set Федерального резервного банка Филадельфии, чтобы получить первую оценку (first vintage), и просим LLM дать самую раннюю оценку этих индикаторов.
Используемые текстовые данные включают заголовки первой полосы The Wall Street Journal (WSJ) из Factiva, стенограммы отчётных конференц-звонков из Capital IQ, фирменные заголовки и новостную базу RavenPack. Датасет новостей первой полосы WSJ содержит 90 123 заголовка с января 1990 по февраль 2025 — в среднем около 9 заголовков на дату. По каждому набору заголовков мы просим LLM назвать дату и уровень S&P 500 на следующий торговый день. Датасет конференц-звонков начинается в январе 2006 и заканчивается в мае 2024. Мы извлекаем вступительное заявление CEO, анонимизируем текст методом нейтрализации сущностей по Engelberg et al. (2025) и просим LLM назвать фирму, квартал и год звонка.
Аналогичный тест мы реализуем для фирменных заголовков с января 2000 по июнь 2024. Мы следуем процедурам фильтрации по базе RavenPack как в Lopez-Lira, Tang (2023): оставляем только заголовки с релевантностью 100, только полные статьи и пресс-релизы, исключаем заголовки категорий «stock-gain» и «stock-loss» и избегаем повторов, требуя «event similarity days» больше 90 и удаляя дубликаты. Получаем выборку из 1 358 737 заголовков по 4 391 уникальной фирме с января 2000 по июнь 2024. Около 70% заголовков — из «ночных» статей, вышедших до 9:00 или после 16:00, остальные 30% — внутридневные.
5. Результаты
В этом разделе мы представляем всестороннюю оценку запоминания GPT-4o экономических и финансовых данных: макроиндикаторы, рыночные индексы, отдельные акции, заголовки — и попытки смягчить запоминание фальшивыми отсечками знаний и маскированием. Во всех этих областях мы оцениваем способность модели воспроизводить точные значения, идентифицировать контекстные детали и соблюдать ограничения. Наша цель — изучить масштаб и селективность запоминания, подчёркивая последствия для использования LLM в экономическом прогнозировании и трудности изоляции подлинной предсказательной способности. Каждый подраздел исследует конкретный тип данных или стратегию смягчения, складывая цельную картину того, как запоминание проявляется и сохраняется.
Во-первых, мы устанавливаем существование запоминания тестами прямого извлечения на данных до отсечки, запрашивая у модели конкретные значения только по названиям переменных и датам. Высокая точность в этих тестах — недвусмысленное свидетельство запоминания. Во-вторых, мы исследуем результативность после отсечки как описательное свидетельство о загрязнении данных. Когда выборки после отсечки малы, тесты гипотез имеют низкую мощность для различения подлинного прогнозного навыка и необнаруженного запоминания. Поэтому мы интерпретируем результаты после отсечки осторожно: слабая результативность после отсечки описательно согласуется с отсутствием загрязнения данных, но наши выборки после отсечки часто малы и не составляют окончательных статистических тестов.
5.1. Воспроизведение макроэкономических данных
Для оценки запоминания GPT-4o макроэкономических индикаторов мы тестировали её способность воспроизводить месячные значения по различным переменным (квартальные для ВВП). В базовом анализе используются данные с января 1990 по сентябрь 2023 — всё внутри отсечки обучения модели (октябрь 2023). Важно, что для сравнения мы также исследуем период после отсечки с октября 2023 по февраль 2025. Индикаторы разделены на две группы: ставки (рост ВВП, инфляция, уровень безработицы, доходность 10-летних трежерис) и уровни (закладки домов, VIX, nonfarm payrolls). Для ставок мы запрашивали процентные значения, оценивая точность через среднюю ошибку (ME), среднюю абсолютную ошибку (MAE), пороговую точность (правильная идентификация превышения порога) и направленную точность (правильное направление изменения от предыдущего периода). Для уровней мы запрашивали сырые значения, с ошибками относительно фактических уровней через среднюю процентную ошибку (MPE), среднюю абсолютную процентную ошибку (MAPE), пороговую и направленную точность. Мы также исследовали уровни за 10-летний период перед отсечкой для изучения эффектов недавности. Результативность измеряется относительно фактических значений макроиндикаторов; результаты — в таблице 1.10
Результаты обнаруживают сильную способность GPT-4o воспроизводить макроэкономические данные. Рисунок 3 строит воспроизведённые значения против фактических, а также ошибку оценки для роста ВВП, инфляции, уровня безработицы и доходности 10-летних трежерис. Ряды воспроизведённых и фактических значений почти идентичны, особенно в более недавние периоды. Для ставок модель демонстрирует почти идеальное воспроизведение: средние абсолютные ошибки от 0.03% (безработица) до 0.15% (рост ВВП), пороговая точность выше 96% по всем индикаторам — до 98% для 10-летних трежерис и 99% для безработицы. Этот набор результатов говорит, что GPT-4o запомнила эти процентные индикаторы с высокой точностью.
| Панель A: Ставки | ME (%) | MAE (%) | Порог. точн. (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Отказы |
|---|---|---|---|---|---|---|---|
| До отсечки, 01/1990 — 09/2023 | |||||||
| Рост ВВП | 0.01 | 0.15 | 96.27 | 96.99 | −0.27 | 134 | 1 |
| Инфляция | 0.00 | 0.04 | 98.02 | 93.07 | −0.11 | 405 | 0 |
| Безработица | −0.00 | 0.03 | 99.26 | 83.42 | 0.09 | 405 | 0 |
| 10-л. трежерис | −0.00 | 0.06 | 98.52 | 88.12 | −0.40 | 405 | 0 |
| После отсечки, 10/2023 — 02/2025 | |||||||
| Рост ВВП | 0.01 | 0.95 | 40.00 | 100.00 | — | 6 | 0 |
| Инфляция | 0.35 | 0.38 | 47.06 | 56.25 | 0.70 | 17 | 0 |
| Безработица | −0.20 | 0.26 | 52.94 | 31.25 | 0.47 | 17 | 0 |
| 10-л. трежерис | −0.24 | 0.48 | 29.41 | 50.00 | 0.16 | 17 | 0 |
| Панель B: Уровни | MPE (%) | MAPE (%) | Порог. точн. (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Отказы |
|---|---|---|---|---|---|---|---|
| До отсечки, 01/1990 — 09/2023 | |||||||
| VIX | 3.25 | 6.74 | 94.62 | 87.40 | −0.42 | 390 | 15 |
| Закладки домов | −2.38 | 3.92 | 100.00 | 81.91 | −0.24 | 399 | 6 |
| Nonfarm Payrolls | −7.65 | 66.30 | 95.56 | 94.06 | −0.11 | 405 | 0 |
| Недавний период до отсечки, 10/2014 — 09/2023 | |||||||
| VIX | 0.04 | 0.34 | 100.00 | 98.13 | −0.20 | 108 | 0 |
| Закладки домов | −0.22 | 1.06 | 95.28 | 98.10 | −0.14 | 106 | 2 |
| Nonfarm Payrolls | −0.00 | 0.00 | 100.00 | 100.00 | −0.14 | 108 | 0 |
| После отсечки, 10/2023 — 02/2025 | |||||||
| VIX | 16.87 | 21.14 | 50.00 | 61.54 | — | 14 | 3 |
| Закладки домов | 2.25 | 8.54 | 35.29 | 56.25 | — | 17 | 0 |
| Nonfarm Payrolls | 69.51 | 97.44 | 58.82 | 68.75 | −0.21 | 17 | 0 |
Рисунок недоступен для встраивания — смотреть в оригинале
Для уровней воспроизведение остаётся высоким: пороговые точности 94–100% по всем индикаторам за весь период до обучения. Более того, при фокусе на последнем 10-летнем отрезке выборки до обучения результативность улучшается драматически: средние абсолютные процентные ошибки падают до 1.06% для закладок домов, 0.34% для VIX и 0.00% для nonfarm payrolls, а пороговая точность растёт до 95–100%. Этот эффект недавности указывает на более сильное запоминание свежих данных — вероятно, из-за более плотной представленности в обучающем корпусе.
Напротив, метрики оценки в периоде после отсечки воспроизведения не предполагают. Для ставок средние абсолютные ошибки значительно растут — от 0.26% (безработица) до 0.95% (рост ВВП). Пороговая точность падает до 29.41% (10-летние трежерис) — 52.94% (безработица). Для уровней — тот же слом воспроизведения. Средняя абсолютная процентная ошибка резко подскакивает по сравнению с воспроизведением в недавнем периоде до отсечки: например, для nonfarm payrolls — с 0% до 97.4%. Пороговая точность падает с более чем 94% по всем индикаторам до 35.3% (закладки), 50.0% (VIX) и 58.8% (nonfarm payrolls).
Высокая точность воспроизведения для ставок и недавних уровней подчёркивает проблему запоминания при оценке прогнозных способностей LLM в течение периода обучения. Способность модели воспроизводить точные макроэкономические значения, особенно для процентных индикаторов и недавних периодов, говорит, что видимый прогнозный успех на данных до отсечки может проистекать из извлечения запомненной информации, а не подлинного экономического анализа. Более слабая результативность для уровней за полный период, особенно для волатильных индикаторов вроде nonfarm payrolls, намекает на селективное запоминание, при котором определённые типы данных или временные отрезки удерживаются менее надёжно. С другой стороны, воспроизведения после отсечки мы не наблюдаем.
5.2. Воспроизведение рыночных индексов
Далее мы оцениваем запоминание GPT-4o данных рыночных индексов, тестируя способность воспроизводить дневные и месячные значения S&P 500, Dow Jones Industrial Average (DJIA) и Nasdaq Composite на данных с января 1990 по февраль 2025. Для тестов числового воспроизведения мы запрашивали точные закрытия на дневной частоте — и без контекста, и с уровнями двух предыдущих дней, — а также месячные доходности. Дополнительно мы оценивали направленные изменения (вверх/вниз) и относительную результативность пар индексов на месячной частоте. Метрики: MPE, MAPE и направленная точность (доля предсказаний, правильно определивших направление изменения к предыдущему периоду) для числовых предсказаний и точность для направленных задач и задач относительной результативности — всё в сравнении с фактическими значениями.
Результаты приведены в таблице 2 с разделением периодов до отсечки (до октября 2023) и после (после октября 2023) для изоляции эффектов запоминания. Для точных дневных уровней до отсечки GPT-4o демонстрирует сильное воспроизведение: MAPE 0.61% для S&P 500, 0.53% для DJIA и 1.80% для Nasdaq Composite, направленная точность от 69.4% (Nasdaq) до 80.7% (DJIA). Контекст слегка улучшает точность для S&P 500 (0.50%) и Nasdaq (1.06%). Прямой запрос доходностей, тестируемый помесячно, даёт более высокую направленную точность (79.5–85.2%), отражая устойчивое запоминание направленных трендов. Другие тесты дополнительно подтверждают запоминание: прямой запрос направления («вверх» или «вниз») даёт точность выше 79% по всем индексам, а точность относительной результативности — от 82.9% (S&P 500 против Nasdaq) до 87.1% (S&P 500 против DJIA).
Напротив, после отсечки результативность рушится. Например, без контекста MAPE раздувается до 13.01–20.48% для точных уровней, а направленная точность падает до почти случайных уровней (44.0–49.3%). Схожие свидетельства для воспроизведения с контекстом: направленная точность 51.9–54.4% после отсечки — существенно ниже, чем 68.6–80.8% до отсечки. Эти результаты не указывают на утечку данных за дату отсечки обучения.
| Панель A: Числовые тесты | MPE (%) | MAPE (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Отказы |
|---|---|---|---|---|---|---|
| Дневные уровни: до отсечки, 02.01.1990 — 29.09.2023 | ||||||
| SP500 | 0.12 | 0.61 | 80.58 | −0.14 | 8 488 | 0 |
| DJIA | 0.11 | 0.53 | 80.66 | −0.36 | 8 488 | 0 |
| Nasdaq Composite | 0.18 | 1.80 | 69.38 | −0.12 | 8 488 | 0 |
| Дневные уровни: после отсечки, 02.10.2023 — 28.02.2025 | ||||||
| SP500 | −16.78 | 16.87 | 45.70 | −0.10 | 292 | 62 |
| DJIA | −12.96 | 13.01 | 49.26 | −0.14 | 271 | 83 |
| Nasdaq Composite | −20.40 | 20.48 | 44.03 | −0.25 | 294 | 60 |
| Дневные уровни: до отсечки с контекстом, 02.01.1990 — 29.09.2023 | ||||||
| SP500 | 0.13 | 0.50 | 80.78 | −0.16 | 8 488 | 0 |
| DJIA | 0.06 | 0.46 | 80.06 | −0.17 | 8 488 | 0 |
| Nasdaq Composite | 0.00 | 1.06 | 68.62 | −0.18 | 8 488 | 0 |
| Дневные уровни: после отсечки с контекстом, 02.10.2023 — 28.02.2025 | ||||||
| SP500 | 0.00 | 0.64 | 54.40 | −0.07 | 319 | 35 |
| DJIA | −0.04 | 0.54 | 53.17 | 0.02 | 332 | 22 |
| Nasdaq Composite | −0.03 | 0.92 | 51.85 | −0.09 | 298 | 56 |
| Месячные доходности: до отсечки, 01/1990 — 09/2023 | ||||||
| SP500 | −0.70 | 3.36 | 85.19 | 0.27 | 405 | 0 |
| DJIA | −0.70 | 3.28 | 80.49 | 0.26 | 405 | 0 |
| Nasdaq Composite | −1.03 | 4.83 | 79.51 | 0.21 | 405 | 0 |
| Месячные доходности: после отсечки, 10/2023 — 02/2025 | ||||||
| SP500 | −1.16 | 3.20 | 41.67 | −0.28 | 12 | 5 |
| DJIA | −0.80 | 3.18 | 30.77 | −0.06 | 13 | 4 |
| Nasdaq Composite | −2.46 | 4.07 | 41.67 | −0.39 | 12 | 5 |
| Панель B: Другие тесты | Точность (%) | Калибровка увер. |
|---|---|---|
| Месячные направленные изменения: до отсечки | ||
| SP500 | 82.80 | 0.33 |
| DJIA | 80.63 | 0.29 |
| Nasdaq Composite | 79.36 | 0.29 |
| Месячная относительная результативность: до отсечки | ||
| SP500, DJIA | 87.10 | 0.23 |
| SP500, NDAQ | 82.86 | 0.49 |
| NDAQ, DJIA | 83.87 | 0.42 |
Резкая точность до отсечки, особенно для точных уровней и относительной результативности, подчёркивает масштабное запоминание GPT-4o исторических данных индексов, создавая трудности для прогнозных исследований в экономике и финансах. Способность модели воспроизводить точные закрытия и правильно определять направленные тренды внутри периода обучения означает, что любой видимый предсказательный успех может отражать запомненные данные, а не аналитическую способность. Ничтожное улучшение от контекста и полный провал результативности после отсечки подкрепляют вывод, что эти результаты проистекают из экспозиции обучающим данным. Эти находки предостерегают от использования LLM для исторического анализа рынка без гарантии, что данные вне их обучающего охвата: выходы рискуют быть артефактами запоминания, а не подлинного экономического предвидения.
5.3. Идентификация дат заголовков
В этом разделе мы оцениваем способность LLM извлекать информацию о датах из заголовков первой полосы и, в свою очередь, предсказывать агрегированный фондовый индекс. Для этого мы предъявляем GPT-4o наборы заголовков первой полосы The Wall Street Journal (примерно 9 заголовков в день) из нашего датасета в 90 123 заголовка с января 1990 по февраль 2025, не раскрывая даты публикации. Мы просили модель определить, когда эти заголовки появились, и — в отдельном варианте теста — предсказать уровень S&P 500 на следующий торговый день. Результативность оценивается несколькими метриками точности: точность года, точность месяца и года, точность точной даты, средняя абсолютная разница в днях и калибровка уверенности. Сравнивая результаты между заголовками до отсечки (где запоминание возможно) и после отсечки (где оно невозможно), мы можем чётко разграничить инференциальные способности модели и её способность воспроизводить запомненную хронологию.
Результаты — в таблице 3. GPT-4o демонстрирует замечательное запоминание хронологии заголовков внутри периода обучения. Для заголовков до отсечки она достигает точности 98.5% в определении правильного года и 90.4% — правильного месяца и года. Даже для точной даты модель достигает 47.0% — значимо выше случайного уровня. Когда модель ошибается, её оценки остаются близкими к фактической дате: средняя абсолютная разница — 9.5 дня.
В разительном контрасте для заголовков, опубликованных после даты отсечки обучения, результативность драматически деградирует по всем метрикам. Точность года падает до 28.8%, месяца и года — до 20.7%, точной даты — до всего 7.9%. Средняя абсолютная разница вырастает до 414.5 дня — по сути случайное угадывание.
| Ср. разница, дни | Ср. абс. разница, дни | Точн. года (%) | Точн. месяца и года (%) | Точн. даты (%) | Калибровка увер. | MPE S&P 500 (%) | MAPE S&P 500 (%) | |
|---|---|---|---|---|---|---|---|---|
| Даты заголовков | ||||||||
| Период до обучения | −0.77 | 9.52 | 98.45 | 90.38 | 47.03 | −0.10 | — | — |
| Период после обучения | 413.46 | 414.54 | 28.81 | 20.71 | 7.86 | −0.12 | — | — |
| Даты заголовков и уровни | ||||||||
| Период до обучения | −1.30 | 9.63 | 98.50 | 90.31 | 39.31 | −0.10 | 0.00 | 0.01 |
| Период после обучения | 456.84 | 457.13 | 26.20 | 19.47 | 5.53 | 0.29 | −0.21 | 0.22 |
Схожую картину мы наблюдали, расширив тест: модель должна дать и дату заголовка, и соответствующий уровень S&P 500 на следующий торговый день. Для периода до обучения модель достигает высокой временной точности при почти идеальном воспроизведении значений индекса (средняя абсолютная процентная ошибка всего 0.01%). Для заголовков после обучения и идентификация дат, и предсказания уровней индекса стали значимо менее точными.
Резкий разрыв результативности на дате отсечки обучения даёт убедительное свидетельство, что видимое «знание» моделью финансовой хронологии проистекает в первую очередь из запоминания, а не из вывода или рассуждения. Эта находка вызывает серьёзные опасения по поводу использования LLM для анализа исторических связей между новостными событиями и движениями рынка внутри их периода обучения: ответы могут отражать запомненные ассоциации, а не подлинные аналитические инсайты.
5.4. Воспроизведение цен отдельных акций
Дополняя более ранние результаты по рыночным индексам, в этом разделе мы исследуем запоминание на уровне отдельных бумаг. В частности, мы тестируем способность модели воспроизводить цены закрытия конца месяца для заметных акций («Великолепная семёрка») и отдельных акций в кросс-секции.
5.4.1. Акции «Великолепной семёрки»
Мы начинаем анализ с акций «Великолепной семёрки» (META, GOOGL, AMZN, TSLA, NVDA, MSFT, AAPL) с января 1990 по сентябрь 2023 — до отсечки обучения модели (октябрь 2023). Мы запрашивали цены и без контекста, и с ценами закрытия двух предыдущих месяцев, используя данные CRSP. Результативность оценивалась через MPE, MAPE и направленную точность (правильное направление изменения к предыдущему месяцу) в сравнении с фактическими ценами закрытия. Метрики — в таблице 4; факт против оценки без контекста — на рисунках 4 и 5.
Результаты выявляют неравномерную точность воспроизведения по акциям с заметным улучшением при наличии контекста. Без контекста (панель A) GPT-4o лучше всего справляется с более недавно листингованными акциями, такими как META (MAPE 0.37%, направленная точность 99.26%), но испытывает трудности с акциями с длинной историей: AAPL (ошибка 36.44%, точность 72.61%) и MSFT (26.62%, 76.75%). Ошибки высоки и для NVDA (23.92%) и TSLA (9.99%), что указывает на селективное запоминание, связанное с длиной ценового ряда или заметностью данных. С контекстом точность улучшается значительно (панель B): MAPE падает до 0.40% для META, 0.84% для GOOGL и 5.89% для AAPL, а направленная точность растёт до 98.52%, 95.52% и 83.91% соответственно. Это контекстное усиление зеркалит слабые улучшения для рыночных индексов, показывая, что недавние ценовые подсказки помогают модели точнее заякорить воспроизведение, особенно для акций с длинной историей.
| Панель A: Без контекста | MPE (%) | MAPE (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Начало | Конец | Отказы |
|---|---|---|---|---|---|---|---|---|
| До отсечки, 01/1990 — 09/2023 | ||||||||
| META | 0.18 | 0.37 | 99.26 | −0.08 | 137 | 05/2012 | 09/2023 | 0 |
| GOOGL | −1.41 | 1.79 | 93.42 | −0.19 | 229 | 08/2004 | 09/2023 | 1 |
| AMZN | −5.87 | 7.98 | 91.77 | −0.12 | 317 | 05/1997 | 09/2023 | 0 |
| TSLA | −9.21 | 9.99 | 92.45 | −0.13 | 160 | 06/2010 | 09/2023 | 0 |
| NVDA | −20.60 | 23.92 | 77.05 | −0.53 | 293 | 01/1999 | 09/2023 | 4 |
| MSFT | −25.72 | 26.62 | 76.75 | −0.65 | 401 | 01/1990 | 09/2023 | 14 |
| AAPL | −35.14 | 36.44 | 72.61 | −0.54 | 399 | 01/1990 | 09/2023 | 6 |
| После отсечки, 10/2023 — 02/2025 | ||||||||
| META | −29.59 | 29.60 | 50.00 | 0.48 | 5 | 10/2023 | 02/2025 | 12 |
| GOOGL | 138.06 | 170.09 | 55.56 | −0.98 | 10 | 10/2023 | 02/2025 | 7 |
| AMZN | −22.06 | 22.06 | 42.86 | 0.48 | 8 | 10/2023 | 02/2025 | 7 |
| TSLA | −0.81 | 20.15 | 100.00 | 0.61 | 6 | 10/2023 | 02/2025 | 11 |
| NVDA | 436.43 | 436.43 | 100.00 | −0.64 | 8 | 10/2023 | 02/2025 | 9 |
| MSFT | −19.25 | 19.25 | 45.45 | −0.48 | 12 | 10/2023 | 02/2025 | 5 |
| AAPL | −15.46 | 15.46 | 30.00 | 0.36 | 11 | 10/2023 | 02/2025 | 6 |
| Панель B: С контекстом | MPE (%) | MAPE (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Начало | Конец | Отказы |
|---|---|---|---|---|---|---|---|---|
| До отсечки, 01/1990 — 09/2023 | ||||||||
| META | −0.18 | 0.40 | 98.52 | −0.10 | 136 | 05/2012 | 09/2023 | 1 |
| GOOGL | −0.27 | 0.84 | 95.52 | 0.10 | 224 | 08/2004 | 09/2023 | 6 |
| AMZN | −0.42 | 3.12 | 93.35 | 0.02 | 317 | 05/1997 | 09/2023 | 0 |
| TSLA | −0.87 | 2.34 | 94.87 | −0.17 | 157 | 06/2010 | 09/2023 | 3 |
| NVDA | 1.01 | 8.80 | 80.68 | −0.17 | 296 | 01/1999 | 09/2023 | 1 |
| MSFT | 1.24 | 4.57 | 84.71 | −0.21 | 400 | 01/1990 | 09/2023 | 5 |
| AAPL | −1.37 | 5.89 | 83.91 | −0.25 | 405 | 01/1990 | 09/2023 | 0 |
| После отсечки, 10/2023 — 02/2025 | ||||||||
| META | −5.04 | 5.29 | 50.00 | 0.14 | 7 | 10/2023 | 02/2025 | 10 |
| GOOGL | 0.88 | 6.26 | 50.00 | −0.36 | 9 | 10/2023 | 02/2025 | 8 |
| AMZN | −2.72 | 6.06 | 54.55 | 0.54 | 12 | 10/2023 | 02/2025 | 5 |
| TSLA | −5.67 | 10.75 | 60.00 | 0.02 | 11 | 10/2023 | 02/2025 | 6 |
| NVDA | 85.89 | 99.39 | 66.67 | 0.45 | 10 | 10/2023 | 02/2025 | 7 |
| MSFT | −0.80 | 2.75 | 50.00 | −0.14 | 9 | 10/2023 | 02/2025 | 8 |
| AAPL | −2.90 | 4.12 | 55.56 | −0.10 | 10 | 10/2023 | 02/2025 | 7 |
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Факт против оценки с контекстом для NVDA, AAPL и MSFT показан на рисунке 6. В сравнении с рисунком 5 этот рисунок показывает, почему любая результативность запоминания даёт лишь нижнюю границу. Ошибки существенно уменьшаются, когда мы даём ChatGPT цены за два предыдущих месяца. Эта ситуация значима, поскольку при прогнозировании исследователи обычно предоставляют контекстную информацию.
В целом эти результаты расширяют наши результаты по рыночным индексам, подчёркивая, что запоминание GPT-4o неоднородно по бумагам и чувствительно к контекстным подсказкам и специфике акций. Высокая точность для META и GOOGL, особенно с контекстом, параллельна сильному воспроизведению недавних макроуровней и значений индексов, указывая на устойчивое запоминание заметных, часто упоминаемых данных. Напротив, большие ошибки для давно листингованных акций вроде AAPL и MSFT даже с контекстом согласуются со слабым воспроизведением долгосрочных макроуровней, указывая на возможное «размывание» старых данных в обучающем корпусе. Это селективное запоминание усиливает вызов для финансовых исследований: видимый прогнозный успех для отдельных акций внутри периода обучения может отражать запомненные цены, а не предсказательную способность, что требует оценок на данных после отсечки для методологической строгости.
5.4.2. Отдельные акции в кросс-секции
Чтобы расширить анализ запоминания GPT-4o, мы исследуем также воспроизведение цен закрытия конца месяца для отдельных акций, сгруппированных по рыночной капитализации, за январь 1990 — декабрь 2024. Акции делятся на квинтили капитализации с границами по акциям только NYSE. Мы случайно отбираем 50 акций из каждого квинтиля с ежегодным перевыбором для учёта изменений размера, используя ценовые данные CRSP. Мы тестируем воспроизведение без контекста, с ценами двух предыдущих месяцев и на недавнем 10-летнем периоде до отсечки для оценки эффектов недавности. Метрики (MPE, MAPE и направленная точность) — в таблице 5. Факт против оценки — на рисунке 7.
| Панель A: Без контекста Квинтиль | MPE (%) | MAPE (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Отказы |
|---|---|---|---|---|---|---|
| До отсечки, 01/1990 — 09/2023 | ||||||
| 1 | 1.20 | 24.70 | 42.66 | −0.10 | 11 925 | 6 828 |
| 2 | −0.55 | 19.17 | 48.78 | −0.13 | 12 262 | 6 394 |
| 3 | −3.04 | 17.06 | 51.02 | −0.32 | 13 077 | 5 469 |
| 4 | −3.36 | 14.18 | 53.64 | −0.22 | 13 593 | 4 908 |
| 5 | −4.55 | 11.29 | 61.11 | −0.26 | 14 816 | 3 576 |
| Недавний период, 01/2014 — 09/2023 | ||||||
| 1 | 4.24 | 15.24 | 48.62 | −0.03 | 5 415 | 96 |
| 2 | 2.71 | 10.18 | 58.59 | −0.04 | 5 448 | 26 |
| 3 | 1.53 | 6.45 | 63.61 | −0.02 | 5 403 | 20 |
| 4 | 0.54 | 4.79 | 69.21 | 0.01 | 5 309 | 10 |
| 5 | 0.21 | 3.16 | 79.54 | −0.01 | 5 444 | 7 |
| После отсечки, 10/2023 — 12/2024 | ||||||
| 1 | 53.36 | 97.83 | 29.71 | 0.01 | 238 | 479 |
| 2 | 27.24 | 46.06 | 39.47 | 0.03 | 302 | 426 |
| 3 | 12.63 | 39.18 | 38.79 | 0.04 | 290 | 440 |
| 4 | −6.04 | 23.52 | 37.14 | −0.03 | 322 | 413 |
| 5 | 0.23 | 27.32 | 46.36 | 0.03 | 390 | 348 |
| Панель B: С контекстом Квинтиль | MPE (%) | MAPE (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Отказы |
|---|---|---|---|---|---|---|
| До отсечки, 01/1990 — 09/2023 | ||||||
| 1 | 1.35 | 10.80 | 74.46 | 0.01 | 18 187 | 565 |
| 2 | 1.47 | 10.14 | 74.35 | −0.01 | 18 029 | 627 |
| 3 | 0.65 | 8.47 | 74.01 | −0.03 | 17 839 | 707 |
| 4 | 1.15 | 7.77 | 74.45 | −0.01 | 17 767 | 734 |
| 5 | 0.72 | 5.73 | 75.58 | −0.06 | 17 565 | 827 |
| Недавний период, 01/2014 — 09/2023 | ||||||
| 1 | 1.86 | 10.69 | 73.35 | −0.01 | 5 376 | 135 |
| 2 | 0.97 | 8.55 | 73.62 | −0.04 | 5 311 | 163 |
| 3 | 0.45 | 6.68 | 72.88 | −0.10 | 5 192 | 231 |
| 4 | 0.47 | 5.48 | 74.52 | −0.10 | 5 083 | 236 |
| 5 | 0.35 | 3.29 | 80.56 | −0.11 | 5 217 | 234 |
| После отсечки, 10/2023 — 12/2024 | ||||||
| 1 | 10.55 | 25.56 | 73.50 | 0.03 | 533 | 184 |
| 2 | 1.32 | 11.49 | 76.40 | 0.04 | 525 | 203 |
| 3 | 0.95 | 9.93 | 72.38 | −0.11 | 456 | 274 |
| 4 | 0.90 | 8.74 | 72.18 | −0.10 | 455 | 280 |
| 5 | 1.44 | 9.06 | 76.02 | 0.01 | 438 | 300 |
Рисунок недоступен для встраивания — смотреть в оригинале
Результаты показывают более слабое воспроизведение по сравнению с «Великолепной семёркой», с улучшением точности для более крупных акций и недавних периодов. Без контекста в периоде до отсечки MAPE высоки: от 11.29% для квинтиля 5 (крупнейшие акции) до 24.70% для квинтиля 1 (наименьшие). Направленная точность низка: 42.66–61.11%. Высокие доли отказов указывают на неуверенность по менее заметным акциям. За недавний 10-летний период ошибки значительно снижаются: от 3.16% (квинтиль 5) до 15.24% (квинтиль 1), направленная точность растёт до 48.6–79.5% при почти нулевых отказах — эхо эффекта недавности в макроуровнях. После отсечки ошибки подскакивают: MAPE от 23.52% до 97.83%, направленная точность всех квинтилей ниже 46.4%, у квинтиля 1 — лишь 29.7%. С контекстом направленная точность улучшается: все квинтили достигают минимум 74% в периоде до отсечки. Более крупные акции стабильно показывают лучшее воспроизведение — вероятно, из-за большей заметности данных, в согласии с более сильными результатами «Великолепной семёрки».
Эти находки дополняют результаты по «Великолепной семёрке», обнаруживая, что запоминание GPT-4o слабеет для менее заметных акций, особенно мелких, и сильнее всего для недавних данных крупной капитализации. Высокие ошибки и отказы для мелких акций контрастируют с точностью для META или GOOGL, указывая, что запоминание смещено к широко освещаемым бумагам, — аналогично устойчивому воспроизведению индексов и макроставок. Эффекты недавности и контекста параллельны улучшениям в предыдущих тестах, но более низкая направленная точность с контекстом указывает на пределы улавливания трендов для разнообразных портфелей. Снова: это селективное запоминание подчёркивает риск полагаться на LLM в историческом анализе акций — видимая прогнозная точность может проистекать из запомненных цен заметных акций, а не из широкого предсказательного инсайта, что усиливает необходимость оценок после отсечки.
5.5. Могут ли LLM следовать промптам с «фальшивой» отсечкой знаний?
Чтобы оценить, способна ли GPT-4o придерживаться инструкций не использовать информацию после искусственно наложенной даты отсечки (фальшивой отсечки), мы тестируем её результативность в предсказании темпов роста реального ВВП США за период с марта 1990 по июнь 2023.
Мы проектируем три промптовых условия с искусственной отсечкой в декабре 2010: (i) и системное, и пользовательское сообщения явно ограничивают знания данными до 2010; (ii) фальшивую отсечку накладывает только системный промпт; (iii) только пользовательский промпт. Задача — предсказать квартальный рост ВВП год-к-году; данные разделены на периоды до фальшивой отсечки (1990–2010) и после (с 2011), чтобы оценить соблюдение ограничения. Метрики: MPE, MAPE, направленная точность и число отказов — в таблице 6.
Когда отсечку до 2010 навязывают и системный, и пользовательский промпты, GPT-4o хорошо работает до этой искусственной отсечки (MAE 0.27%, направленная точность 95.12%), но испытывает трудности после неё: выше ошибка (0.59%), ниже точность (69.23%) и 38 отказов из 51 наблюдения после фальшивой отсечки. По предложению 1 такое поведение наблюдательно эквивалентно нескольким противоречащим объяснениям: ограничение действительно работает (модель не может обращаться к информации после 2010), поведенческое подавление (модель сохраняет запомненную информацию, но научилась её скрывать) или стратегическое послушание (модель отыгрывает то, что, по её мнению, сказала бы ограниченная модель). Мы также находим, что результаты схожи, когда отсечку 2010 указывает только пользовательский промпт. Напротив, когда отсечку указывает только системный промпт, точность до фальшивой отсечки слегка улучшается (ошибка 0.11%, точность 97.59%), но результативность после фальшивой отсечки остаётся неправдоподобно сильной (ошибка 0.05%, точность 98.00%) при единственном отказе из 50 наблюдений. Этот минимальный спад точности после фальшивой отсечки указывает, что без подкрепления пользовательскими инструкциями модель, вероятно, обращается к запомненным данным, подрывая ограничение отсечки.11
| ME (%) | MAE (%) | Порог. точн. (%) | Направл. точн. (%) | Калибровка увер. | Начало | Конец | Num Obs | Отказы | |
|---|---|---|---|---|---|---|---|---|---|
| Рост ВВП: отсечка и в системном, и в пользовательском сообщении | |||||||||
| До фальш. отсечки | 0.07 | 0.27 | 97.59 | 95.12 | −0.02 | 01.03.1990 | 01.12.2010 | 83 | 0 |
| После фальш. отсечки | 0.58 | 0.59 | 69.23 | 75.00 | 0.51 | 01.03.2011 | 01.09.2023 | 13 | 38 |
| Рост ВВП: отсечка только в системном сообщении | |||||||||
| До фальш. отсечки | 0.02 | 0.11 | 97.59 | 97.56 | −0.12 | 01.03.1990 | 01.12.2010 | 83 | 0 |
| После фальш. отсечки | −0.01 | 0.05 | 98.00 | 100.00 | −0.24 | 01.03.2011 | 01.09.2023 | 50 | 1 |
| Рост ВВП: отсечка только в пользовательском сообщении | |||||||||
| До фальш. отсечки | 0.08 | 0.22 | 98.80 | 96.34 | −0.18 | 01.03.1990 | 01.12.2010 | 83 | 0 |
| После фальш. отсечки | 0.60 | 0.61 | 66.67 | 70.59 | −0.15 | 01.03.2011 | 01.09.2023 | 18 | 32 |
В дополнительном наборе анализов, представленных в таблице A4, мы проводим аналогичный эксперимент для уровней S&P 500 на дневной частоте. В тесте «скользящей фальшивой отсечки» мы модифицируем пользовательский промпт инструкцией «Do not use any knowledge after time {t − 1}», где {t − 1} — дата перед той, которую мы просим воспроизвести. Мы применяем эту процедуру в периодах до и после отсечки и находим, что результаты совпадают с исходной процедурой воспроизведения без инструкций фальшивой отсечки: точность до отсечки по-прежнему очень высока по сравнению с периодом после. Для исходного бенчмарка модель воспроизводит уровни индекса до отсечки с малыми ошибками (MAPE 0.61%, направленная точность 80.6%), но плохо работает после настоящей отсечки (MAPE 16.9%, направленная точность 45.7%). Со скользящей фальшивой отсечкой результативность до отсечки остаётся сильной (MAPE 0.81%, направленная точность 69.6%), а после — слабой (MAPE 17.2%, направленная точность 42.2%). Мы также проводим два подвыборочных теста для периодов 1990–2008 и 2009–2023 с индивидуальными датами отсечки 31 декабря 1999 и 31 декабря 2015 соответственно. Результаты до и после этих дат должны быть схожими в обоих периодах, поскольку все даты попадают в период до настоящей отсечки модели. Мы это и находим: для подвыборки 1990–2008 MAPE даже падает с 1.39% до фальшивой отсечки до 0.67% после, а направленная точность растёт с 59.3% до 74.4%. Аналогично, в подвыборке 2009–2023 MAPE слегка падает с 0.05% до 0.03%, а направленная точность слегка растёт с 97.3% до 98.1%.
Эти результаты хорошо согласуются с нашими более ранними находками по макроиндикаторам и рыночным индексам, где высокая точность до отсечки отражает запоминание. Сильная результативность после фальшивой отсечки без пользовательского подкрепления (точность 98%) демонстрирует, что промптовые ограничения эмпирически не предотвращают доступ к запомненным данным. Более того, даже если бы фальшивые отсечки успешно снижали точность, предложение 1 устанавливает: мы не могли бы верифицировать, что ограничение действительно сработало, — сниженная точность может отражать либо успешное ограничение исторической информацией, либо то, что модель научилась подавлять известные ответы. Эти наблюдательно эквивалентные исходы делают целевой эстиманд фундаментально неидентифицируемым. Высокая доля отказов при двойных промптах указывает на частичное соблюдение, но не на полную изоляцию от запомненной информации, иллюстрируя практическую трудность ограничения выходов модели даже при теоретической невозможности верификации.
5.6. Тестирование эффективности маскирования
Чтобы оценить, способно ли маскирование помешать GPT-4o обращаться к запомненной информации, мы исследуем её способность определять фирму, год и квартал анонимизированных стенограмм отчётных конференц-звонков с января 2006 по сентябрь 2023 — целиком внутри периода до отсечки обучения (октябрь 2023). Стенограммы анонимизированы методом нейтрализации сущностей Engelberg et al. (2025) с удалением идентифицирующих деталей вроде названий компаний и дат. Мы фокусируемся на акциях «Великолепной семёрки» (AAPL, META, MSFT, GOOGL, NVDA, TSLA, AMZN) и портфелях по терцилям капитализации (крупные, средние, мелкие), измеряя результативность через среднюю разницу лет, среднюю абсолютную разницу лет и точности определения точного года, квартала с годом и фирмы. Результаты — в таблице 7.
| Панель A: «Великолепная семёрка» Тикер | Ср. разница лет | Ср. абс. разница лет | Точн. года (%) | Точн. квартала и года (%) | Точн. фирмы (%) | Num Obs |
|---|---|---|---|---|---|---|
| До отсечки, 01/2006 — 09/2023 | ||||||
| AAPL | −0.03 | 0.05 | 95.95 | 93.24 | 100.00 | 74 |
| META | 0.22 | 0.27 | 73.47 | 2.04 | 100.00 | 49 |
| MSFT | −0.67 | 0.78 | 61.64 | 1.37 | 100.00 | 73 |
| GOOGL | −1.05 | 1.59 | 59.46 | 6.76 | 91.89 | 74 |
| NVDA | −1.34 | 1.66 | 50.00 | 1.61 | 93.55 | 62 |
| TSLA | −3.27 | 3.45 | 39.29 | 3.57 | 85.71 | 56 |
| AMZN | −1.87 | 2.11 | 30.67 | 4.00 | 85.33 | 75 |
| Панель B: Фирмы по капитализации Размер | Ср. разница лет | Ср. абс. разница лет | Точн. года (%) | Точн. квартала и года (%) | Точн. фирмы (%) | Num Obs |
|---|---|---|---|---|---|---|
| До отсечки, 01/2006 — 09/2023 | ||||||
| Крупные | −1.54 | 1.92 | 44.69 | 8.09 | 65.77 | 593 |
| Средние | −1.87 | 2.37 | 39.93 | 7.34 | 40.78 | 586 |
| Мелкие | −1.52 | 2.26 | 33.26 | 5.79 | 30.90 | 466 |
GPT-4o демонстрирует замечательную способность деанонимизировать стенограммы, особенно для заметных фирм. Для AAPL модель достигает 100% точности фирмы, 95.95% точности года и 93.24% точности квартала с годом при средней абсолютной разнице лет всего 0.05 года. META и MSFT также показывают идеальную идентификацию фирмы (100%), хотя точность года падает до 73.47% и 61.64% соответственно, а точность квартала с годом низка (2.04% и 1.37%). Результативность чуть слабее для GOOGL (91.89% точности фирмы), NVDA (93.55%), TSLA (85.71%) и AMZN (85.33%), с точностью года от 30.67% до 59.46% и средними абсолютными разницами лет 1.59–3.45 года. По терцилям капитализации точность фирмы снижается с 65.77% для крупных до 30.90% для мелких, а точность года — с 44.69% до 33.26%, указывая на более сильное запоминание крупных, заметных фирм — в согласии с нашими портфельными результатами.
Эти результаты демонстрируют, что маскирование эмпирически не предотвращает деанонимизацию. Однако даже когда тесты деанонимизации не срабатывают, предложение 1 и замечание 1 устанавливают: нельзя заключить, что ограничение сработало — неудавшаяся реконструкция может означать и подлинную анонимизацию, и просто недоступность запомненного знания через данный конкретный тест. Высокая точность фирмы и года для «Великолепной семёрки» (100% для AAPL/META/MSFT) — нижняя граница того, что модель запомнила; фактическое знание, вероятно, существенно больше. Более слабая результативность для мелких акций зеркалит более высокие ошибки для портфелей малой капитализации, подкрепляя вывод, что запоминание благоприятствует хорошо представленным сущностям. Способность определять фирмы и годы из анонимизированных текстов означает, что LLM могут использовать тонкие подсказки для доступа к запомненным данным, подрывая маскирование как защиту от загрязнения прогнозов. Эта находка подчёркивает необходимость данных после отсечки для оценки истинной предсказательной способности: замаскированные исторические анализы всё равно могут отражать запомненные исходы, а не подлинный инсайт.
В следующем анализе мы дополнительно проверяем, способно ли маскирование помешать GPT-4o обращаться к запомненной информации, повторяя тест для фирменных новостных заголовков с января 2000 по сентябрь 2023 (период до отсечки). Дополнительно есть данные с октября 2023 по июнь 2024 в периоде после отсечки. В отличие от стенограмм звонков, фирменные заголовки — короткие тексты с более однородными формулировками. После нейтрализации сущностей рутинные новости — торговля акциями со стороны топ-менеджеров или анонсы отчётности — почти неразличимы между фирмами и во времени. По этим причинам в данном тесте мы группировали заголовки по месяцам, а не давали GPT-4o по одному.
В таблице 8 мы показываем, что такой подход к маскированию мог разумно затемнить даты новостей, но GPT-4o угадывала фирмы «Великолепной семёрки» с точностью 70%, верхний дециль по капитализации — с точностью 55.64%, верхний квинтиль — 46.71%. Даже по датам, хотя LLM не сверхточна, она угадывала год в периоде до отсечки почти в 20% случаев, а в более недавнем периоде около отсечки октября 2023 точность вырастала до 50%.
| Панель A: Даты и фирмы по анонимизированным заголовкам | Ср. разница мес. | Ср. абс. разница мес. | Точн. года (%) | Точн. фирмы (%) | Num Obs |
|---|---|---|---|---|---|
| Различные периоды | |||||
| Период до обучения | 37.76 | 55.17 | 19.65 | 21.13 | 8 714 |
| До обучения, недавний (01/2014–09/2023) | 26.34 | 42.44 | 23.44 | 23.21 | 2 133 |
| До обучения, около отсечки (01/2022–09/2023) | −3.65 | 13.01 | 50.47 | 27.96 | 422 |
| Период после обучения | −15.26 | 15.26 | 15.79 | 28.57 | 133 |
| Различные размеры фирм | |||||
| «Великолепная семёрка» | 13.39 | 26.10 | 33.33 | 70.00 | 390 |
| Верхний дециль | 18.68 | 32.17 | 30.25 | 55.64 | 638 |
| Верхний квинтиль | 23.14 | 37.46 | 25.71 | 46.71 | 1 276 |
| Крупные | 25.99 | 44.36 | 22.59 | 32.68 | 5 233 |
| Мелкие и средние | 43.55 | 62.98 | 15.11 | 8.12 | 1 145 |
| Панель B: Децили размера Дециль | Ср. разница мес. | Ср. абс. мес. | Точн. года (%) | Точн. фирмы (%) | Мес.-фирм | Уник. фирм | Мин. кап. (\$ млрд) | Макс. кап. (\$ млрд) | Медиана кап. (\$ млрд) |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 48.00 | 67.49 | 14.29 | 8.79 | 637 | 263 | 0.25 | 2.28 | 1.04 |
| 2 | 40.76 | 60.54 | 14.73 | 9.09 | 638 | 255 | 2.28 | 5.65 | 3.88 |
| 3 | 31.48 | 51.50 | 22.10 | 12.54 | 638 | 226 | 5.65 | 12.01 | 8.57 |
| 4 | 27.58 | 48.54 | 17.43 | 23.86 | 637 | 173 | 12.01 | 21.32 | 16.33 |
| 5 | 25.75 | 47.96 | 20.06 | 25.24 | 638 | 147 | 21.32 | 36.98 | 27.93 |
| 6 | 20.47 | 42.65 | 22.41 | 36.21 | 638 | 106 | 36.98 | 59.98 | 47.59 |
| 7 | 29.21 | 48.53 | 21.51 | 36.73 | 637 | 79 | 59.98 | 99.72 | 78.37 |
| 8 | 22.02 | 34.97 | 28.53 | 36.83 | 638 | 52 | 99.72 | 157.61 | 127.24 |
| 9 | 27.59 | 42.74 | 21.16 | 37.77 | 638 | 42 | 157.61 | 241.22 | 191.06 |
| 10 | 18.71 | 32.21 | 30.14 | 55.57 | 637 | 32 | 241.22 | 2831.10 | 355.71 |
| Панель C: Даты по деанонимизированным заголовкам | Ср. разница мес. | Ср. абс. разница мес. | Точн. месяца и года (%) | Num Obs |
|---|---|---|---|---|
| Период до обучения | 1.53 | 3.94 | 76.71 | 8 733 |
| До обучения, недавний | 2.85 | 3.52 | 77.81 | 2 181 |
| Период после обучения | −1.20 | 1.47 | 57.89 | 152 |
Хотя для фирменных заголовков подход маскирования оказался более эффективным, он всё равно не может полностью помешать GPT-4o реконструировать различную идентифицирующую информацию. Однако возможно, что при достаточно коротком замаскированном тексте GPT-4o не сможет эффективно определить идентичность фирмы. Для проверки этой гипотезы мы дополнительно исследуем эффективность маскирования фирменных заголовков, отбирая по 50 акций на каждый дециль капитализации (с ежегодным перевыбором) и тестируя идентификацию фирм GPT-4o по одиночным заголовкам. В отличие от предыдущего теста, замаскированные заголовки даются по одному, а не группой. Поскольку одиночные заголовки, как правило, коротки и типовы, особенно после маскирования, у LLM мало различающей информации для идентификации фирм. Поэтому доли воспроизведения в периоде до отсечки в целом ниже, как показано в панели A таблицы 9. Однако они выше случайного уровня во всех децилях. Например, точность фирмы для дециля 10 с крупнейшими фирмами — 7.53%, более чем в пять раз выше случайного угадывания фирмы из дециля (1.41%). Напротив, результаты периода после отсечки показывают слабую способность воспроизведения: как показано в панели B, точность фирмы близка к случайной или ниже во всех децилях.
| Дециль | Точн. фирмы (%) | Случайно (%) | Самые частые новости (%) | AAPL (%) | Заголовков | Уник. фирм | Медиана кап. (\$ млрд) | Мин. кап. (\$ млрд) | Макс. кап. (\$ млрд) |
|---|---|---|---|---|---|---|---|---|---|
| Панель A: До отсечки, 01/2000 — 09/2023 | |||||||||
| 1 | 0.57 | 0.20 | 0.00 | 0.00 | 11 500 | 501 | 0.45 | 0.25 | 1.09 |
| 2 | 0.70 | 0.25 | 0.00 | 0.00 | 11 449 | 408 | 1.08 | 0.47 | 2.15 |
| 3 | 0.78 | 0.26 | 0.00 | 0.00 | 11 642 | 384 | 1.82 | 0.76 | 3.49 |
| 4 | 1.00 | 0.29 | 0.00 | 0.00 | 11 489 | 345 | 2.94 | 1.49 | 6.07 |
| 5 | 1.01 | 0.30 | 0.00 | 0.00 | 11 682 | 332 | 4.82 | 2.23 | 10.96 |
| 6 | 1.26 | 0.35 | 0.00 | 0.49 | 11 352 | 284 | 8.01 | 3.13 | 17.71 |
| 7 | 1.80 | 0.43 | 0.00 | 0.00 | 11 615 | 232 | 13.87 | 5.49 | 46.48 |
| 8 | 2.99 | 0.54 | 0.00 | 0.00 | 11 262 | 184 | 24.37 | 9.22 | 92.19 |
| 9 | 3.89 | 0.73 | 0.00 | 1.13 | 11 263 | 137 | 51.52 | 17.10 | 239.51 |
| 10 | 7.53 | 1.41 | 7.01 | 3.11 | 12 012 | 71 | 174.06 | 42.13 | 2434.21 |
| Панель B: После отсечки, 10/2023 — 06/2024 | |||||||||
| 1 | 0.92 | 1.59 | 0.00 | 0.00 | 433 | 63 | 0.26 | 0.00 | 0.54 |
| 2 | 0.00 | 1.96 | 0.00 | 0.00 | 378 | 51 | 0.87 | 0.38 | 1.42 |
| 3 | 0.00 | 1.96 | 0.00 | 0.00 | 425 | 51 | 1.79 | 1.30 | 2.43 |
| 4 | 0.50 | 1.85 | 0.00 | 0.00 | 404 | 54 | 2.82 | 2.17 | 3.95 |
| 5 | 0.00 | 2.00 | 0.00 | 0.00 | 396 | 50 | 4.98 | 3.22 | 7.40 |
| 6 | 1.95 | 2.27 | 0.00 | 0.00 | 411 | 44 | 8.85 | 5.81 | 14.40 |
| 7 | 0.72 | 2.50 | 0.00 | 0.00 | 415 | 40 | 15.59 | 8.94 | 27.22 |
| 8 | 2.84 | 2.44 | 0.00 | 0.00 | 423 | 41 | 38.44 | 17.34 | 71.06 |
| 9 | 3.79 | 3.13 | 0.00 | 0.00 | 396 | 32 | 97.38 | 33.65 | 428.85 |
| 10 | 6.94 | 7.14 | 42.82 | 10.05 | 418 | 14 | 497.48 | 83.83 | 2434.21 |
Эти результаты маскирования обнаруживают фундаментальный компромисс. Чтобы LLM могла генерировать полезные прогнозы, текст должен содержать специфическую контекстную информацию. Но именно эта специфичность делает возможной идентификацию сущности. Рассмотрим замаскированный заголовок: «Фирма x сообщила о слабом спросе на продукт y в регионе z». Если детали достаточно генеричны, чтобы предотвратить идентификацию («некая компания сообщила о слабом спросе»), сигнал теряет предсказательную ценность. Если детали достаточно специфичны для предсказания («производитель смартфонов сообщил о слабом спросе в Китае в Q4 2018»), они раскрывают идентичность (Apple). Достичь одновременно эффективной анонимизации и содержательной прогнозной силы крайне сложно. В сочетании с замечанием 1, устанавливающим, что неудавшаяся идентификация не доказывает успешную анонимизацию, этот компромисс говорит, что маскирование не может надёжно решить проблему запоминания для задач прогнозирования.
5.7. Борьба с lookahead-смещением через экономическую логику
В предыдущих разделах мы показали, что эффективность смягчения lookahead-смещения через искусственно наложенные даты отсечки знаний и анонимизацию маскированием сущностей ограничена. Естественный вопрос: может ли дальнейшая абстракция — удаление исходной формулировки с сохранением экономического смысла — ослабить связь между текстом и внутренней памятью GPT-4o. В этом разделе мы тестируем, снижает ли преобразование фирменных заголовков в анонимизированную «экономическую логику» долю запоминания, всё ещё позволяя модели делать прогнозы. Если абстракция успешно удаляет идентифицирующую информацию и структуру предложения, сохраняя лежащую в основе экономическую логику, модель должна быть способна прогнозировать доходности акций, но уже не должна восстанавливать фирму или дату заголовка. Валидное маскирование требует и будущей инвариантности (задача не зависит от информации, раскрытой после момента $t$), и обнаружимого навыка (точность выше бейзлайна). Мы находим, что эта процедура даёт обнаружимый навык, но тесты реконструкции обнаруживают множественные пути, через которые модель может обращаться к запомненной информации, — то есть маскирование не достигает будущей инвариантности.
Мы начинаем с набора фирменных заголовков. Для каждого заголовка мы просим LLM описать эффект этой новости для фирмы, опуская любую конкретику, — вывести только экономическую логику одним предложением. Дополнительно мы просим LLM анонимизировать эту экономическую логику техникой маскирования. Затем, используя построенное на первом шаге множество экономической логики, мы просим LLM предсказать, вырастет акция или упадёт, давая ей анонимизированную экономическую логику. Пример — на рисунке 8.
Пример экономической логики (одно предложение):
Заголовок: Amazon Launches Kindle in Mexico
Экономическая логика: The firm could experience increased revenue and market expansion opportunities due to tapping into a new consumer base in Mexico.
Анонимизированная экономическая логика: The firm could experience increased revenue and market x expansion opportunities due to tapping into a new consumer base x in location x.
Таблица 10 приводит результаты тестирования этой процедуры на акциях «Великолепной семёрки» с GPT-4o на дневной частоте. Для каждого дня, где была новость до 9:00 текущего дня или после 16:00 предыдущего, мы просим LLM предсказать по анонимизированной экономической логике, вырастет акция или упадёт от открытия к закрытию. Для периода до отсечки направленные точности по всем семи акциям превышают 50% (от 50.74% до 58.19%), удовлетворяя требованию обнаружимого навыка для валидного маскирования.
Для проверки условия будущей инвариантности мы пытаемся реконструировать идентифицирующую информацию из анонимизированной экономической логики, прося GPT-4o определить фирму и дату новости из анонимизированного текста. Результаты показывают: для заметных акций (AAPL, META, MSFT, TSLA, AMZN) GPT-4o может определять фирму из анонимизированной экономической логики с точностью от 11.9% до 46.3%. Для GOOGL и NVDA точности идентификации ниже (3.3% и 0.6% соответственно). Реконструкция дат в основном не удаётся: LLM практически не способна угадать точную дату и определяет год лишь в 3–13% случаев в зависимости от акции. Для заметных акций успешная реконструкция фирмы прямо демонстрирует нарушение будущей инвариантности: модель может обращаться к информации, связывающей замаскированную задачу с запомненным знанием о том, что произошло после даты заголовка.
| Панель A: Точность прогноза Тикер | Точн. прогноза без «не знаю» (%) | Точн. прогноза с «не знаю» (%) | Num Obs | Заголовков | Заголовков (до 9:00 / после 16:00) | Ср. заголовков в день |
|---|---|---|---|---|---|---|
| До отсечки, 01/2000 — 09/2023 | ||||||
| AAPL | 54.89 | 49.51 | 919 | 2 857 | 2 008 | 2.04 |
| META | 50.77 | 41.38 | 319 | 933 | 660 | 1.62 |
| MSFT | 50.74 | 46.06 | 1 333 | 3 671 | 2 385 | 1.77 |
| GOOG | 56.61 | 48.74 | 835 | 2 009 | 1 284 | 1.47 |
| NVDA | 55.29 | 44.53 | 411 | 1 070 | 775 | 1.73 |
| TSLA | 58.19 | 49.43 | 352 | 899 | 621 | 1.59 |
| AMZN | 52.85 | 41.14 | 722 | 2 025 | 1 342 | 1.72 |
| После отсечки, 10/2023 — 06/2024 | ||||||
| AAPL | 68.18 | 51.72 | 29 | 107 | 62 | 1.95 |
| META | 50.00 | 43.75 | 16 | 44 | 32 | 1.76 |
| MSFT | 55.88 | 52.78 | 36 | 126 | 64 | 1.62 |
| GOOG | 74.07 | 60.61 | 33 | 97 | 62 | 2.16 |
| NVDA | 53.33 | 41.11 | 19 | 68 | 46 | 1.94 |
| TSLA | 71.43 | 62.50 | 16 | 62 | 24 | 1.72 |
| AMZN | 53.33 | 51.61 | 31 | 88 | 59 | 1.69 |
| Панель B: Идентификация анонимизированной экономической логики Тикер | Точн. фирмы (%) | Точн. года (%) | Точн. даты (%) |
|---|---|---|---|
| До отсечки, 01/2000 — 09/2023 | |||
| AAPL | 46.3 | 3.5 | 0.0 |
| META | 11.9 | 7.2 | 0.4 |
| MSFT | 21.6 | 3.9 | 0.1 |
| GOOG | 3.3 | 7.3 | 0.0 |
| NVDA | 0.6 | 7.5 | 0.0 |
| TSLA | 27.5 | 12.2 | 0.0 |
| AMZN | 19.2 | 5.4 | 0.0 |
| После отсечки, 10/2023 — 06/2024 | |||
| AAPL | 39.2 | 34.0 | 0.0 |
| META | 11.4 | 25.0 | 4.5 |
| MSFT | 27.0 | 26.2 | 0.0 |
| GOOG | 1.9 | 27.1 | 0.0 |
| NVDA | 5.9 | 30.9 | 0.0 |
| TSLA | 27.4 | 21.0 | 0.0 |
| AMZN | 22.7 | 27.3 | 0.0 |
Для более широкой кросс-секции акций эта процедура даёт направленные точности, схожие с маскированием коротких текстов, как показано в таблице 11. Доли идентификации фирм из анонимизированной экономической логики выше случайных (случайного выбора уникальной фирмы из дециля) для децилей 5–10 в периоде до отсечки, хотя ниже, чем для «Великолепной семёрки». В периоде после отсечки доли идентификации фирм падают ниже случайного бенчмарка — в согласии с тем, что модель не видела этих данных при обучении.
| Дециль | Точн. фирмы (%) | Случайно (%) | Самые частые новости (%) | AAPL (%) | Заголовков | Уник. фирм | Медиана кап. (\$ млрд) | Мин. кап. (\$ млрд) | Макс. кап. (\$ млрд) |
|---|---|---|---|---|---|---|---|---|---|
| Панель A: До отсечки, 01/2000 — 09/2023 | |||||||||
| 1 | 0.03 | 0.20 | 0.00 | 0.00 | 11 500 | 501 | 0.45 | 0.25 | 1.09 |
| 2 | 0.01 | 0.25 | 0.00 | 0.00 | 11 449 | 408 | 1.08 | 0.47 | 2.15 |
| 3 | 0.11 | 0.26 | 0.00 | 0.00 | 11 642 | 384 | 1.82 | 0.76 | 3.49 |
| 4 | 0.02 | 0.29 | 0.00 | 0.00 | 11 489 | 345 | 2.94 | 1.49 | 6.07 |
| 5 | 0.34 | 0.30 | 0.00 | 0.00 | 11 682 | 332 | 4.82 | 2.23 | 10.96 |
| 6 | 0.42 | 0.35 | 0.00 | 0.49 | 11 352 | 284 | 8.01 | 3.13 | 17.71 |
| 7 | 0.41 | 0.43 | 0.00 | 0.00 | 11 615 | 232 | 13.87 | 5.49 | 46.48 |
| 8 | 1.16 | 0.54 | 0.00 | 0.00 | 11 262 | 184 | 24.37 | 9.22 | 92.19 |
| 9 | 1.86 | 0.73 | 0.00 | 1.13 | 11 263 | 137 | 51.52 | 17.10 | 239.51 |
| 10 | 6.15 | 1.41 | 7.01 | 3.11 | 12 012 | 71 | 174.06 | 42.13 | 2434.21 |
| Панель B: После отсечки, 10/2023 — 06/2024 | |||||||||
| 1 | 0.23 | 1.59 | 0.00 | 0.00 | 433 | 63 | 0.26 | 0.00 | 0.54 |
| 2 | 0.00 | 1.96 | 0.00 | 0.00 | 378 | 51 | 0.87 | 0.38 | 1.42 |
| 3 | 0.00 | 1.96 | 0.00 | 0.00 | 425 | 51 | 1.79 | 1.30 | 2.43 |
| 4 | 0.00 | 1.85 | 0.00 | 0.00 | 404 | 54 | 2.82 | 2.17 | 3.95 |
| 5 | 0.00 | 2.00 | 0.00 | 0.00 | 396 | 50 | 4.98 | 3.22 | 7.40 |
| 6 | 0.49 | 2.27 | 0.00 | 0.00 | 411 | 44 | 8.85 | 5.81 | 14.40 |
| 7 | 0.00 | 2.50 | 0.00 | 0.00 | 415 | 40 | 15.59 | 8.94 | 27.22 |
| 8 | 0.47 | 2.44 | 0.00 | 0.00 | 423 | 41 | 38.44 | 17.34 | 71.06 |
| 9 | 1.52 | 3.12 | 0.00 | 0.00 | 396 | 32 | 97.38 | 33.65 | 428.85 |
| 10 | 4.55 | 7.14 | 42.82 | 10.05 | 418 | 14 | 497.48 | 83.83 | 2434.21 |
Дополнительно таблица 12 показывает, что GPT-4o может определять правильную отраслевую классификацию Фамы–Френча со скоростью, значительно превышающей случайную, даже из анонимизированной экономической логики. При классификации на 5 отраслей модель правильно назначает отрасль «Consumer» в 62.4% случаев в периоде до отсечки и в 59.0% — после. Даже при более гранулярной группировке на 10 отраслей GPT-4o показывает нетривиальную результативность классификации, правильно определяя такие отрасли, как HiTec, Manuf и NoDur, примерно с 20–33% точности.
| Панель A: 5 отраслей (FF5) | Всего | Правильно | Точн. отрасли (%) | Случайно (%) |
|---|---|---|---|---|
| До отсечки, 01/2000 — 09/2023 | ||||
| Cnsmer | 18 175 | 11 337 | 62.4 | 20.0 |
| HiTec | 14 055 | 2 588 | 18.4 | 20.0 |
| Hlth | 5 203 | 308 | 5.9 | 20.0 |
| Manuf | 18 144 | 2 722 | 15.0 | 20.0 |
| Other | 60 640 | 12 532 | 20.7 | 20.0 |
| После отсечки, 10/2023 — 06/2024 | ||||
| Cnsmer | 363 | 214 | 59.0 | 20.0 |
| HiTec | 345 | 42 | 12.2 | 20.0 |
| Hlth | 161 | 6 | 3.7 | 20.0 |
| Manuf | 429 | 52 | 12.1 | 20.0 |
| Other | 2 685 | 609 | 22.7 | 20.0 |
| Панель B: 10 отраслей (FF10) | Всего | Правильно | Точн. отрасли (%) | Случайно (%) |
|---|---|---|---|---|
| До отсечки, 01/2000 — 09/2023 | ||||
| Durbl | 3 225 | 533 | 16.5 | 10.0 |
| Enrgy | 2 867 | 164 | 5.7 | 10.0 |
| HiTec | 11 603 | 2 493 | 21.5 | 10.0 |
| Hlth | 5 200 | 308 | 5.9 | 10.0 |
| Manuf | 12 042 | 2 482 | 20.6 | 10.0 |
| NoDur | 4 332 | 1 347 | 31.1 | 10.0 |
| Other | 60 628 | 11 467 | 18.9 | 10.0 |
| Shops | 10 613 | 431 | 4.1 | 10.0 |
| Telcm | 2 451 | 168 | 6.9 | 10.0 |
| Utils | 3 229 | 25 | 0.8 | 10.0 |
| После отсечки, 10/2023 — 06/2024 | ||||
| Durbl | 48 | 6 | 12.5 | 10.0 |
| Enrgy | 66 | 3 | 4.5 | 10.0 |
| HiTec | 312 | 62 | 19.9 | 10.0 |
| Hlth | 161 | 6 | 3.7 | 10.0 |
| Manuf | 271 | 50 | 18.4 | 10.0 |
| NoDur | 133 | 44 | 33.1 | 10.0 |
| Other | 2 685 | 544 | 20.3 | 10.0 |
| Shops | 182 | 4 | 2.2 | 10.0 |
| Telcm | 33 | 0 | 0.0 | 10.0 |
| Utils | 92 | 0 | 0.0 | 10.0 |
Этот результат реконструкции отраслей критичен для оценки будущей инвариантности. Даже когда модель не может прямо идентифицировать конкретную фирму, она реконструирует отраслевую принадлежность со скоростью, намного превышающей случайную. По замечанию 1 тесты реконструкции дают лишь нижние границы доступной информации: неспособность реконструировать идентичность фирмы не доказывает, что модель не может обращаться к другой запомненной контекстной информации (отраслевые паттерны, деловая конъюнктура, макроэкономический контекст), связывающей замаскированную задачу с информацией, раскрытой после момента $t$. Успешная реконструкция отраслей демонстрирует, что альтернативные информационные пути остаются доступными, даже когда прямая идентификация фирмы не удаётся. Вместе с результатами прямой идентификации фирм для заметных акций эти находки указывают, что процедура экономической логики не удовлетворяет требованию будущей инвариантности для валидного маскирования.
5.8. Запоминание в эмбеддингах?
Ещё один вопрос — проявляют ли признаки запоминания эмбеддинги LLM. Недавние работы, использующие эмбеддинги LLM в финансовых приложениях, такие как Chen, Kelly, Xiu (2022), дают существенно лучшие предсказания доходностей акций, чем традиционные индикаторы или более простые NLP-методы. Вне финансов показано, что эмбеддинги утекают примерно столько же чувствительной информации, сколько сам текст (Morris et al. 2023). Эмбеддинги — числовые векторные представления текста, генерируемые LLM. Эти векторы содержат семантическое содержание входного текста, включая контекстную информацию из паттернов, встреченных моделью при предобучении. Способность восстановить исторически отчётные показатели из эмбеддингов промптов, в которых опущен числовой токен, была бы сильным свидетельством запоминания в эмбеддингах LLM.
Используя модель text-embedding-3-large, мы сначала кодируем серию промптов, где опущено конкретное числовое значение на конкретную дату для макроиндикатора, например «In Q4 2020, the earliest estimate of the US GDP growth rate was».12 Затем мы обучаем Ridge-регрессию с силой регуляризации $\lambda = 0.01$ на этих эмбеддингах и соответствующих экономических данных для предсказания четырёх экономических индикаторов: роста ВВП, инфляции, ставки 10-летних трежерис и уровня безработицы. Ridge-регрессия позволяет контролировать мультиколлинеарность среди высокоразмерных признаков эмбеддингов. Скользящее окно обучается на последних пяти годах данных (месячных для инфляции, ставки 10-летних трежерис и безработицы; квартальных для роста ВВП) и предсказывает следующую точку. Рисунок 9 показывает по каждому индикатору сравнение фактических значений с предсказанными по скользящим окнам и 5-летней простой скользящей средней.13
Рисунок недоступен для встраивания — смотреть в оригинале
Таблица 13 приводит корреляции между предсказанными и фактическими значениями, сравнивая модель с 5-летним скользящим окном и бенчмарк — 5-летнюю простую скользящую среднюю (SMA).14 Мы находим свидетельства запоминания в эмбеддингах инфляции и уровня безработицы. В частности, корреляция между фактическими и предсказанными по скользящему окну значениями инфляции (0.892) — большое улучшение над SMA-бенчмарком (0.333). Безработица тоже показывает высокую согласованность (0.927 против 0.385 у SMA), особенно при использовании недавней истории. Рост ВВП стабильно даёт корреляцию около нуля (−0.114 скользящее окно, −0.074 SMA). Эмбеддинги почти не дают сигнала для роста ВВП, но при обучении с расширяющимся окном чуть превосходят SMA-бенчмарк (корреляция 0.169). В совокупности эти результаты говорят, что эмбеддинги действительно несут некоторые ассоциации, но не согласованно по всем экономическим индикаторам.15
| Ряд | Корреляция: скользящее окно | Корреляция: SMA | Roll−SMA | t-стат. Roll−SMA |
|---|---|---|---|---|
| Эмбеддинги даты и переменной | ||||
| Инфляция | 0.892 | 0.333 | 0.559 | t = 20.07 |
| 10-л. трежерис | 0.965 | 0.857 | 0.108 | t = 15.76 |
| Безработица | 0.927 | 0.385 | 0.542 | t = 23.26 |
| Рост ВВП | −0.114 | −0.074 | −0.040 | t = −0.35 |
| Эмбеддинги дат | ||||
| Инфляция | 0.882 | 0.333 | 0.549 | t = 18.45 |
| 10-л. трежерис | 0.966 | 0.857 | 0.109 | t = 15.85 |
| Безработица | 0.915 | 0.385 | 0.530 | t = 21.77 |
| Рост ВВП | −0.124 | −0.074 | −0.050 | t = −0.44 |
| Перемешанные эмбеддинги даты и переменной | ||||
| Инфляция | 0.118 | 0.333 | −0.215 | t = −4.17 |
| 10-л. трежерис | 0.806 | 0.857 | −0.051 | t = −4.86 |
| Безработица | 0.301 | 0.385 | −0.084 | t = −2.06 |
| Рост ВВП | 0.001 | −0.074 | 0.075 | t = 0.64 |
| Случайные числовые векторы | ||||
| Инфляция | 0.308 | 0.333 | −0.025 | t = −2.05 |
| 10-л. трежерис | 0.853 | 0.857 | −0.004 | t = −2.33 |
| Безработица | 0.365 | 0.385 | −0.020 | t = −2.66 |
| Рост ВВП | −0.135 | −0.074 | −0.061 | t = −1.28 |
Естественное опасение после этого результата — не улавливают ли Ridge-регрессии на эмбеддингах временные паттерны вместо проявления запоминания. Таблица 13 также содержит набор плацебо-тестов, где мы модифицируем значимую информацию в эмбеддингах. Мы проводим три плацебо-теста: (1) эмбеддинги, содержащие только информацию о дате; (2) эмбеддинги, являющиеся случайной перестановкой эмбеддингов даты и переменной; (3) набор векторов из случайно сгенерированных чисел. Эти тесты показывают: предсказательная сила сохраняется, когда временная информация остаётся в эмбеддингах, и исчезает, когда мы её удаляем. Для эмбеддингов дат мы по-прежнему видим значимое улучшение результатов скользящего окна над SMA для всех переменных, кроме роста ВВП. Однако результаты скользящего окна для перемешанных эмбеддингов и случайных числовых векторов хуже SMA. Это говорит, что часть предсказательной силы обусловлена кодированием дат в эмбеддингах, даже когда экономический индикатор не включён. Не ослабляя напрямую свидетельства запоминания, эти плацебо-результаты согласуются с утечкой временной информации внутри эмбеддингов, подразумевая, что модель содержит индексированные по времени сигналы. В таких случаях прогнозная результативность может отражать временное запоминание, а не подлинное экономическое рассуждение.
| Эмбеддинги даты и переменной | Эмбеддинги дат | Перемешанные | Случайные векторы | |
|---|---|---|---|---|
| Инфляция | 0.223 (129.61) | 0.219 (114.03) | 0.220 (123.96) | 0.000 (0.25) |
| 10-л. ставка | 0.276 (192.02) | 0.193 (110.40) | 0.262 (149.13) | 0.001 (1.36) |
| Безработица | 0.175 (98.21) | 0.208 (98.91) | 0.169 (104.15) | 0.001 (1.23) |
| Рост ВВП | 0.257 (90.30) | 0.267 (69.24) | 0.252 (99.10) | 0.001 (0.69) |
Эту интерпретацию подкрепляет таблица 14, сравнивающая косинусные сходства между эмбеддингами, построенными из промптов с датой и переменной (или плацебо-эмбеддингами), и эмбеддингами фактических значений экономических индикаторов. По всему набору экономических переменных эмбеддинги даты и переменной в целом ближе к эмбеддингам значений, чем перемешанные или случайные плацебо. Эти паттерны говорят, что модель интернализировала ассоциации между конкретными датами и соответствующими им экономическими состояниями.
| Точн. инверсии (%) | Точн. даты (%) | MAE/MAPE (%) | Корреляция значений | |||||
|---|---|---|---|---|---|---|---|---|
| Реальные | Случ. даты | Реальные | Случ. даты | Реальные | Случ. даты | Реальные | Случ. даты | |
| Уровни S&P 500 (напр. 4200.11) | ||||||||
| Steps = 5, Width = 2 | 13.9 | 8.3 | 40.3 | 25.0 | 30.9 | 45.6 | −0.071 | 0.259 |
| Steps = 10, Width = 2 | 26.4 | 16.7 | 52.8 | 36.1 | 42.3 | 53.0 | 0.350 | 0.100 |
| Steps = 15, Width = 2 | 25.0 | 16.7 | 44.4 | 34.7 | 31.0 | 45.0 | 0.122 | −0.038 |
| Уровни S&P 500, округлённые (напр. 4200) | ||||||||
| Steps = 5, Width = 2 | 34.7 | 29.2 | 51.4 | 36.1 | 209.5 | 151.9 | 0.46 | 0.34 |
| Steps = 10, Width = 2 | 43.1 | 36.1 | 59.7 | 41.7 | 149.8 | 157.6 | 0.30 | 0.46 |
| Steps = 15, Width = 2 | 44.4 | 37.5 | 62.5 | 41.7 | 170.6 | 133.2 | 0.34 | 0.41 |
| Уровни S&P 500, округлённые, с запятыми (напр. 4,200) | ||||||||
| Steps = 5, Width = 2 | 54.2 | 41.7 | 61.1 | 43.1 | 6.3 | 14.4 | 0.43 | 0.32 |
| Steps = 10, Width = 2 | 70.8 | 47.2 | 73.6 | 48.6 | 1.7 | 12.8 | 0.90 | 0.31 |
| Steps = 15, Width = 2 | 73.6 | 50.0 | 77.8 | 52.8 | 0.5 | 12.7 | 0.99 | 0.31 |
| Уровни инфляции | ||||||||
| Steps = 5, Width = 2 | 87.5 | 81.9 | 87.5 | 83.3 | 1.11 | 1.27 | 1 | 1 |
| Steps = 10, Width = 2 | 90.3 | 88.9 | 90.3 | 88.9 | 0.69 | 1.39 | 1 | 1 |
| Steps = 15, Width = 2 | 90.3 | 91.7 | 90.3 | 91.7 | 1.11 | 0.28 | 1 | 1 |
Наконец, мы находим, что инверсия эмбеддингов в текст даёт более высокую точность на текстах, виденных при обучении. Таблица 15 показывает: модель vec2text (Morris et al. 2023; Morris et al. 2024) для инверсии эмбеддингов обратно в текст существенно точнее, когда эмбеддинг соответствует точному промпту с датой и реальным соответствующим экономическим значением, чем для фальшивых плацебо-эмбеддингов. Мы тестируем точность инверсии, точность даты, MAE/MAPE и корреляцию значений для промптов с датой и закрытием S&P 500. Модели инверсии проще восстановить текст из эмбеддинга, когда использованная эмбеддинг-модель, скорее всего, видела даты и исторические значения в непосредственной близости при обучении.16 Мы также находим, что округление закрытий S&P до целых улучшает точность инверсии и точность дат. Более того, добавление запятых в форматирование закрытий поднимает точность инверсии реальных промптов до 73.6%. Только при увеличении ширины поиска до четырёх фальшивые промпты начинают инвертироваться точнее. Короче говоря, плацебо-регрессии, структура косинусных сходств и результативность инверсии дают согласованные свидетельства того, что эмбеддинги нетривиально кодируют исторические экономические состояния.
5.9. Дополнительный анализ
5.9.1. Международные данные
Документируемые нами паттерны воспроизведения не ограничены данными США. Мы проводим дополнительные тесты воспроизведения макроиндикаторов на инфляции и безработице для еврозоны, Великобритании, Японии и Китая. Результаты в таблице A7 показывают схожее поведение, указывая, что запоминание макроэкономических данных распространяется на международный уровень. Рисунок A1 строит воспроизведённые значения инфляции для четырёх международных экономик против фактических; рисунок A2 — воспроизведённые уровни безработицы против фактических.
Мы повторяем тесты воспроизведения фондовых индексов для Euro Stoxx 50 (еврозона), FTSE 100 (Великобритания), Nikkei 225 (Япония) и SSE Composite (Китай). Результаты в таблице A8 показывают схожие паттерны: точность воспроизведения до отсечки намного превышает точность после, что указывает на распространение запоминания индексов и на международные рынки. Однако доли воспроизведения до отсечки для международных индексов менее точны, чем для американских, особенно для Euro Stoxx 50. Рисунок A3 строит воспроизведённые значения четырёх международных индексов против фактических.
5.9.2. Альтернативный промпт
Мы также исследуем, как меняются выходы модели при изменении формулировки промпта на термин «forecast» вместо прямого запроса уровня закрытия, и при предоставлении контекста (закрытий двух предыдущих дней). Результаты — в таблице A9. Без контекста выходы до отсечки остаются точнее случайных (MAPE 2.76% и направленная точность 74.26%), а точность после отсечки деградирует (MAPE 15.30% и направленная точность 43.06%). С контекстом из закрытий двух предыдущих дней MAPE снижается до 0.7–1.1% для обоих периодов, а направленная точность — примерно 50% и до отсечки (48.54%), и после (51.84%).
5.9.3. Запоминание другими LLM
Наконец, мы повторяем тесты воспроизведения макроиндикаторов и фондовых индексов с open-source LLM Llama-3.1-70b-Instruct вместо GPT-4o.17 Результаты также показывают явную способность воспроизводить и макроэкономические данные, и фондовые индексы. Таблица A10 показывает: воспроизведённые значения ставок чрезвычайно близки к фактическим — MAE от 0.06% для безработицы до 0.48% для роста ВВП, пороговая точность выше 91% по всем индикаторам (до 97% для 10-летних трежерис и 99% для безработицы). Этот набор результатов говорит, что Llama-3.1-70b-Instruct запомнила эти процентные индикаторы с высокой точностью, аналогично GPT-4o. В периоде после отсечки MAE удваиваются, а пороговая точность падает до 60–75%.
Для уровней макроиндикаторов воспроизведение слабее, но остаётся нетривиальным. Пороговая точность до отсечки — от 86% для nonfarm payrolls до более 90% для закладок домов и VIX. Однако MAPE для уровней — от 5.51% для закладок до более 200% для nonfarm payrolls. Зеркаля паттерн GPT-4o, ошибки существенно снижаются при взгляде только на последнее десятилетие перед отсечкой знаний (2014–2023): MAPE падает до 3.4% для закладок, 7.6% для VIX и 9.5% для nonfarm payrolls.
Таблица A11 показывает дневные результаты воспроизведения фондовых индексов. Они тоже дают ясную поддержку запоминания, хотя более слабого, чем у GPT-4o. Воспроизведение до отсечки умеренно по точности: MAPE от 2% для DJIA до 4.5% для Nasdaq — ошибки больше, чем у GPT-4o. Однако точность после отсечки намного хуже: ошибки растут до 14–18% по трём индексам. Этот контраст говорит, что Llama, хотя и менее точная, чем GPT-4o, тоже проявляет запоминание в периоде до отсечки.
6. Заключение
Большие языковые модели проявляют значительное запоминание экономических и финансовых данных, что создаёт фундаментальный вызов их использованию для прогнозирования исторических периодов внутри их обучающих данных. Систематическим тестированием мы документируем способность LLM идеально воспроизводить точные числовые значения — уровни S&P 500, уровни безработицы, темпы роста ВВП, цены отдельных акций — с высокой точностью для данных до отсечки, наряду с почти идеальной идентификацией дат заголовков и устойчивой реконструкцией замаскированных сущностей. Это селективное, но повсеместное запоминание может подорвать валидность видимой прогнозной точности LLM, поскольку их выходы для периодов до отсечки часто неотличимы от воспроизведения, а не подлинного предсказания.
Помимо этих эмпирических находок, мы устанавливаем формальные теоретические результаты, показывающие, что проблема запоминания фундаментально неидентифицируема: когда модель видела реализованные исходы при обучении, её контрфактическую прогнозную способность нельзя восстановить из её выходов. Любой наблюдаемый прогноз согласуется и с подлинным аналитическим навыком, и с простым воспроизведением запомненных ответов, делая вывод невозможным. Более того, распространённые средства доказуемо не работают: ограничивающие промпты не могут идентифицировать целевой эстиманд, дообучение чёрным ящиком нельзя верифицировать без наблюдения изменений параметров, а малые выборки после отсечки не имеют статистической мощности для обнаружения запоминания. Эти результаты о невозможности демонстрируют, что проблема не просто эмпирическая, а структурная.
Усилия по смягчению запоминания — наложение искусственных временных границ или анонимизация данных — оказываются неадекватными. Даже при явной инструкции игнорировать информацию после искусственно наложенной даты отсечки LLM выдают неправдоподобно точные прогнозы: точность после фальшивой отсечки (98%) совпадает с уровнями до неё, а не с 40%, наблюдаемыми для действительно невиданных данных после настоящей отсечки. Аналогично, техники маскирования не могут полностью помешать LLM реконструировать идентифицирующую информацию: они используют тонкие контекстные подсказки для деанонимизации сущностей вроде фирм или периодов с высокой долей успеха. Даже когда маскирование блокирует доступ к конкретным сущностям или событиям, модель сохраняет представления отраслевой структуры и макроусловий, позволяя утечке сохраняться. Эти находки указывают, что ни промптовые стратегии, ни анонимизация данных не могут надёжно изолировать прогнозные способности LLM от их запомненного знания, делая такие подходы недостаточными для строгих академических исследований.
Для обеспечения методологической целостности оценки прогнозных способностей LLM должны сосредоточиваться исключительно на данных за пределами их отсечки обучения, где запоминание невозможно. Только тестируя предсказания для периодов после отсечки, исследователи и практики могут уверенно отличить подлинный экономический инсайт от извлечения запомненной информации. Это ограничение требует сдвига в дизайне исследований — приоритета темпорально согласованных моделей или данных после обучения для оценки истинного потенциала LLM в экономических и финансовых приложениях. Это накладывает практические ограничения, особенно для низкочастотных исследований, где достаточные данные после отсечки могут накапливаться годами. Альтернативно исследователи могут применять open-source модели с документированным временным обучением, исключающим целевой период.
Применение нашей методологии для проверки запоминания в конкретных данных, используемых в исследовании, может дать полезную нижнюю границу проблемы запоминания в конкретном приложении. Наши результаты подчёркивают необходимость переоценки многих текущих практик LLM-исследований в экономике и финансах и потребность в надёжных каркасах для решения проблемы запоминания — чтобы заявления о предсказательной силе основывались на фактической прогнозной способности, а не на артефактах экспозиции обучающим данным.
Литература
- Bai, J. J., Boyson, N. M., Cao, Y., Liu, M., Wan, C. (2023). Executives vs. chatbots: Unmasking insights through human-AI differences in earnings conference Q&A. Northeastern U. D'Amore-McKim School of Business Research Paper No. 4480056.
- Beckmann, L., Beckmeyer, H., Filippou, I., Menze, S., Zhou, G. (2024). Unusual Financial Communication: ChatGPT, Earnings Calls, and Financial Markets. SSRN Scholarly Paper.
- Bond, S. A., Klok, H., Zhu, M. (2024). Large language models and financial market sentiment. SSRN 4584928.
- Bozman, A., Fairhurst, D. J., Greene, D. (2025). Better Than a Coin Flip? Merger Success and Artificial Intelligence Models. SSRN Working Paper.
- Breitung, C., Müller, S. (2025). Global Business Networks. Journal of Financial Economics 166: 104007.
- Bybee, J. L. (2023). The Ghost in the Machine: Generating Beliefs with Large Language Models.
- Cao, Y., Chen, L., Tucker, J., Wan, C. (2025). Can Generative AI Help Identify Peer Firms? SSRN Scholarly Paper.
- Chen, J., Tang, G., Zhou, G., Zhu, W. (2023). ChatGPT and Deepseek: Can They Predict the Stock Market and Macroeconomy? SSRN Scholarly Paper.
- Chen, S., Green, T. C., Gulen, H., Zhou, D. (2024). What Does ChatGPT Make of Historical Stock Returns? Extrapolation and Miscalibration in LLM Stock Return Forecasts. SSRN Scholarly Paper.
- Chen, Y., Kelly, B., Xiu, D. (2022). Expected Returns and Large Language Models. SSRN Scholarly Paper.
- Clayton, C., Coppola, A., Maggiori, M., Schreger, J. (2025). Geoeconomic Pressure. Columbia Business School / Stanford GSB Research Paper.
- Degen, D., Kengelbach, J., Kim, D., Sievers, S., Wang, Y. (2024). Large Language Models and M&A: Can ChatGPT Help Forecast M&A Activity? SSRN Scholarly Paper.
- Engelberg, J., Manela, A., Mullins, W., Vulicevic, L. (2025). Entity Neutering. SSRN Scholarly Paper.
- Glasserman, P., Lin, C. (2023). Assessing Look-Ahead Bias in Stock Return Predictions Generated By GPT Sentiment Analysis.
- Hansen, A. L., Horton, J. J., Kazinnik, S., Puzzello, D., Zarifhonarvar, A. (2024). Simulating the Survey of Professional Forecasters. SSRN Scholarly Paper.
- He, S., Lv, L., Manela, A., Wu, J. (2025). Chronologically Consistent Large Language Models.
- Horton, J. J. (2023). Large Language Models as Simulated Economic Agents: What Can We Learn from Homo Silicus? SSRN Electronic Journal.
- Jha, M., Qian, J., Weber, M., Yang, B. (2024). Harnessing Generative AI for Economic Insights. SSRN Scholarly Paper.
- Jha, M., Qian, J., Weber, M., Yang, B. (2025). ChatGPT and Corporate Policies. SSRN Scholarly Paper.
- Kim, A., Muhn, M., Nikolaev, V. (2024). Financial statement analysis with large language models. arXiv:2407.17866.
- Levy, B. (2024). Caution Ahead: Numerical Reasoning and Look-ahead Bias in AI Models. SSRN Scholarly Paper.
- Lopez-Lira, A., Tang, Y. (2023). Can ChatGPT Forecast Stock Price Movements? Return Predictability and Large Language Models. SSRN Electronic Journal.
- Ludwig, J., Mullainathan, S., Rambachan, A. (2025). Large Language Models: An Applied Econometric Framework. Working Paper.
- Manning, B. S., Zhu, K., Horton, J. J. (2024). Automated Social Science: Language Models as Scientist and Subjects. Cambridge, MA.
- Morris, J., Kuleshov, V., Shmatikov, V., Rush, A. (2023). Text Embeddings Reveal (Almost) As Much As Text. In: Proceedings of EMNLP 2023, 12448–12460. ACL.
- Morris, J., Zhao, W., Chiu, J., Shmatikov, V., Rush, A. (2024). Language Model Inversion. In: ICLR 2024.
- Pham, V. H., Cunningham, S. (2024). Can Base ChatGPT Be Used for Forecasting without Additional Optimization? SSRN Scholarly Paper.
- Rahimikia, E., Drinkall, F. (2024). Re(Visiting) Large Language Models in Finance. SSRN Scholarly Paper.
- Ross, J., Kim, Y., Lo, A. W. (2024). LLM Economicus? Mapping the Behavioral Biases of LLMs via Utility Theory.
- Sarkar, S., Vafa, K. (2024). Lookahead Bias in Pretrained Language Models. SSRN Working Paper.
- Sarkar, S. K. (2024). StoriesLM: A Family of Language Models With Time-Indexed Training Data. SSRN Scholarly Paper.
- Tan, L., Wu, H., Zhang, X. (2024). Large Language Models and Return Prediction in China. SSRN Scholarly Paper.
- Van Binsbergen, J. H., Han, X., Lopez-Lira, A. (2022). Textual Analysis of Short-seller Research Reports. SSRN Scholarly Paper.
Приложение A. Промпты
Тексты промптов сохранены на английском языке, как в оригинале: это дословные входы моделей, и их перевод исказил бы методологию.
A.1. Индексы
Контекст.
Context: The closing price of {data name} was {previous closing price 1} on {previous period 1} and {previous closing price 2} on {previous period 2}.
Системное сообщение. Промпты для фондовых индексов, заголовков WSJ, макроиндикаторов и отдельных акций используют следующие системные промпты.
Период до обучения: You're a helpful assistant who always tries to answer to the best of your recollection of facts. Период после обучения: You're a helpful assistant who always tries to answer to the best of your recollection of facts. Your knowledge cutoff date is December 31st, 2025. Your training data covers up to December 31st, 2025.
Промпт: оценка дневного значения.
{context}
What was the {data name} closing value on {date}? Provide your best estimate.
Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
Промпт: месячное направленное предсказание.
{context}
Was the {data name} up or down for the month of {month}, {year}? Provide your best estimate.
Provide an answer that is either "up" or "down". Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: An answer to the question that is either "up" or "down".
- confidence: A number between 0 and 100 indicating your confidence in the answer.
Промпт: месячное процентное изменение.
{context}
By what percentage did the {data name} change for the month of {month}, {year}? Provide your best estimate.
Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
Промпт: сравнение относительной результативности.
{context}
Which performed better in {year}: {data name} or {data name2}? Provide your best estimate.
Provide an answer that is either {data name} or {data name2}. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: An answer to the question that is either {data name} or {data name2}.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
A.2. Заголовки
Промпт: построение новостного контекста. Модели давался следующий контекст, сгенерированный из заголовков Wall Street Journal, опубликованных в один день:
Here are headlines from the Wall Street Journal written on the same day:
{title 1}: {content 1}
{title 2}: {content 2}
...
Тип промпта: вывод даты.
{context}
What is the date of these headlines? Provide your best estimate.
Provide a precise date. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise date in the format "mm/dd/yyyy".
- confidence: A number between 0 and 100 indicating your confidence in the answer.
Тип промпта: предсказание уровня рынка.
{context}
First, infer the date of these headlines. What was the closing value of the {data name} for the next trading day? Provide your best estimate.
You must provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:
- date: The date of the headlines in the format "mm/dd/yyyy".
- answer: The precise numerical answer to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
A.3. Макропеременные
Промпт: месячная ставка.
What was the {data name} in {month}, {year}? Provide your best estimate.
Provide a precise numerical answer in percentage format. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer in percentage format to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
Промпт: месячный уровень.
What was the {data name} in {month}, {year}? Provide your best estimate.
Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
Промпт: квартальная ставка.
What was the {data name} in {quarter} {year}? Provide your best estimate.
Provide a precise numerical answer in percentage format. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer in percentage format to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
Промпт: уровень на конец месяца.
What was the {data name} on {end of month date}? Provide your best estimate.
Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
A.4. Отдельные акции
Контекст.
Context: The closing price of {data name} was {previous closing price 1} on {previous period 1} and {previous closing price 2} on {previous period 2}.
(Если существует лишь одна предыдущая цена закрытия: The closing price of {data name} was {previous closing price 1} on {previous period 1}.)
Промпт: цена закрытия на конец месяца.
{context}
What was the closing price of {ticker str} on {end of month date}? Provide your best estimate.
Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
A.5. Фальшивая отсечка знаний
Промпт: отсечка и в системном, и в пользовательском сообщении.
System message: You're a helpful assistant who always tries to answer to the best of your recollection of facts. Knowledge cutoff: December 31st, 2010 Current date: October 1st, 2023.
User message: For the following tasks, please restrict your knowledge pool to the end of 2010. What was the earliest estimate of the US GDP growth rate in quarter? Provide your best estimate.
Provide a precise numerical answer in percentage format. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer in percentage format to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
Промпт: только системная отсечка.
System message: You're a helpful assistant who always tries to answer to the best of your recollection of facts. Knowledge cutoff: December 31st, 2010 Current date: October 1st, 2023.
User message: What was the earliest estimate of the US GDP growth rate in quarter? Provide your best estimate.
Provide a precise numerical answer in percentage format. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer in percentage format to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
Промпт: только пользовательская отсечка.
System message: You're a helpful assistant who always tries to answer to the best of your recollection of facts.
User message: For the following tasks, please restrict your knowledge pool to the end of 2010. What was the earliest estimate of the US GDP growth rate in quarter? Provide your best estimate.
Provide a precise numerical answer in percentage format. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer in percentage format to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
A.6. Анонимизированные конференц-звонки / фирменные заголовки
Промпт: анонимизация (адаптирован из Engelberg et al. 2025). Полный промпт инструктирует модель анонимизировать весь предоставленный текст так, чтобы никто — даже эксперт-финаналитик — не смог определить компанию или её отрасль. Тикеры заменяются на «ticker x»; имена людей, локации, отрасли, сектора, продукты, услуги, времена, годы, даты и все числа с процентами — на маркеры «name x», «location x», «industry x», «sector x», «product x», «product type x», «product line x», «service x», «time x», «year x», «date x» и «number a», «number b», «number c» соответственно. Ссылки и домены заменяются на «link x», платформы и сервисы — на «service x». Идентификаторы никогда не удаляются — всегда заменяются анонимным аналогом; на выходе — только анонимизированный текст.
Промпт: идентификация (адаптирован из Engelberg et al. 2025).
You will receive a body of text which has been anonymized. You are omniscient. Use all your knowledge and the context to identify which company and industry the text is about, as well as the quarter and year it was written. Make your best guess based on information and context if you are unsure. Please only provide the ticker of the company you have identified. Provide your estimate exactly in the following format, with no other text at all (TIK is your estimate of the ticker, Industry Name is your estimate of the industry, Q is your estimate of the quarter, Y is your estimate of the year): Company Estimate: TIK, Industry Estimate: Industry Name, Quarter Estimate: Q, Year Estimate: Y
[Anonymized Opening Statement/Firm Headline]
A.7. Анонимизированная экономическая логика
Промпт: экономическая логика.
How should the firm be impacted by the following headline? In your explanation, do not include specifics. Only provide the economic logic using three sentences.
[headline]
Промпты анонимизации и идентификации — те же, что в разделе A.6, применённые к экономической логике вместо стенограммы/заголовка.
A.8. Альтернативный промпт
Промпт: «прогноз» дневного значения.
{context}
Can you forecast the {data name} closing value on {date}? You must provide your best numerical estimate even if you cannot predict perfectly. Do not output explanations of your capabilities.
Provide a precise numerical answer. Indicate your level of confidence. Format as a JSON object with the following fields:
- answer: The precise numerical answer to the question. No strings.
- confidence: A number between 0 and 100 indicating your confidence in the answer.
A.9. Промпты Llama-3.1-70b-Instruct
Промпты оценки дневного значения, месячной ставки и месячного уровня повторяют промпты GPT-4o из разделов A.1 и A.3; к промптам месячной ставки и уровня добавлено требование: «You must provide a numerical answer even if you are unable to verify the information. Do not output any additional text.»
Приложение B. Дополнительные рисунки и таблицы
| Панель A: Индексы | Ср. доходность (%) | СКО доходности (%) | Направл. изменение (%) |
|---|---|---|---|
| SP500, дневная | 0.04 | 0.11 | 53.59 |
| DJIA, дневная | 0.05 | 0.15 | 54.97 |
| NASDAQ Composite, дневная | 0.05 | 0.15 | 54.97 |
| SP500, месячная | 0.78 | 0.43 | 64.13 |
| DJIA, месячная | 1.10 | 0.62 | 61.52 |
| NASDAQ Composite, месячная | 1.10 | 0.62 | 61.52 |
| Панель B: Акции (месячные) | Ср. доходность (%) | СКО доходности (%) | Направл. изменение (%) |
|---|---|---|---|
| GOOGL | 1.46 | 1.15 | 60.09 |
| AMZN | 2.53 | 1.67 | 58.23 |
| AAPL | 1.57 | 1.36 | 55.85 |
| MSFT | 1.07 | 1.10 | 58.96 |
| META | 2.34 | 1.12 | 61.76 |
| NVDA | 3.19 | 2.03 | 58.22 |
| TSLA | 3.45 | 1.94 | 52.20 |
| Мелкие акции | 1.56 | 1.59 | 53.33 |
| Средние акции | 0.49 | 1.34 | 51.70 |
| Крупные акции | 0.43 | 1.27 | 52.96 |
| Панель C: Макроставки | Среднее (%) | СКО (%) | Направление (%) | Направл. изменение (%) | ME (%) | MAE (%) |
|---|---|---|---|---|---|---|
| Рост ВВП | 2.39 | 4.48 | 50.36 | 44.53 | −0.00 | 1.93 |
| Инфляция | 2.70 | 1.62 | 31.28 | 42.52 | −0.00 | 1.13 |
| Безработица | 5.71 | 1.75 | 84.16 | 31.99 | 0.00 | 1.34 |
| 10-л. трежерис | 4.23 | 1.97 | 52.01 | 48.82 | 0.00 | 1.62 |
| Панель D: Макроуровни | Среднее | СКО | Направление (%) | Направл. изменение (%) | MPE (%) | MAPE (%) |
|---|---|---|---|---|---|---|
| VIX | 19.86 | 7.15 | 65.62 | 47.48 | 11.25 | 29.07 |
| Закладки домов | 1323.95 | 384.55 | 45.32 | 50.36 | 12.13 | 29.85 |
| Изм. Nonfarm Payrolls | 104.16 | 1062.12 | 37.05 | 43.57 | −58.81 | 188.41 |
| ME (%) | MAE (%) | Порог. точн. (%) | Направл. точн. (%) | Калибровка увер. | Начало | Конец | Num Obs | Отказы | |
|---|---|---|---|---|---|---|---|---|---|
| Рост ВВП: отсечка и в системном, и в пользовательском сообщении | |||||||||
| До фальш. отсечки | 0.20 | 0.40 | 93.65 | 88.71 | 0.06 | 01.03.1990 | 01.12.2005 | 63 | 1 |
| После фальш. отсечки | 0.78 | 1.11 | 50.00 | 71.43 | −0.64 | 01.03.2006 | 01.09.2023 | 8 | 63 |
| Рост ВВП: отсечка только в системном сообщении | |||||||||
| До фальш. отсечки | 0.06 | 0.18 | 96.83 | 95.16 | −0.11 | 01.03.1990 | 01.12.2005 | 63 | 1 |
| После фальш. отсечки | −0.03 | 0.07 | 97.18 | 98.57 | −0.37 | 01.03.2006 | 01.09.2023 | 71 | 0 |
| Рост ВВП: отсечка только в пользовательском сообщении | |||||||||
| До фальш. отсечки | 0.22 | 0.41 | 95.24 | 88.71 | −0.12 | 01.03.1990 | 01.12.2005 | 63 | 1 |
| После фальш. отсечки | 0.61 | 1.05 | 50.00 | 80.00 | −0.38 | 01.03.2006 | 01.09.2023 | 6 | 65 |
| ME (%) | MAE (%) | Порог. точн. (%) | Направл. точн. (%) | Калибровка увер. | Начало | Конец | Num Obs | Отказы | |
|---|---|---|---|---|---|---|---|---|---|
| Рост ВВП: отсечка и в системном, и в пользовательском сообщении | |||||||||
| До фальш. отсечки | 0.15 | 0.46 | 91.26 | 92.16 | −0.17 | 01.03.1990 | 01.12.2015 | 103 | 1 |
| После фальш. отсечки | 0.02 | 0.62 | 55.56 | 87.50 | −0.21 | 01.03.2016 | 01.09.2023 | 9 | 22 |
| Рост ВВП: отсечка только в системном сообщении | |||||||||
| До фальш. отсечки | 0.00 | 0.10 | 98.06 | 97.06 | −0.20 | 01.03.1990 | 01.12.2015 | 103 | 1 |
| После фальш. отсечки | 0.01 | 0.02 | 100.00 | 100.00 | −0.08 | 01.03.2016 | 01.09.2023 | 31 | 0 |
| Рост ВВП: отсечка только в пользовательском сообщении | |||||||||
| До фальш. отсечки | 0.13 | 0.30 | 95.15 | 94.12 | −0.17 | 01.03.1990 | 01.12.2015 | 103 | 1 |
| После фальш. отсечки | 0.69 | 0.71 | 83.33 | 80.00 | 0.18 | 01.03.2016 | 01.09.2023 | 6 | 25 |
| MPE (%) | MAPE (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Отказы | |
|---|---|---|---|---|---|---|
| SP500 до отсечки (исходно) | 0.12 | 0.61 | 80.58 | −0.14 | 8 488 | 0 |
| SP500 после отсечки (исходно) | −16.78 | 16.87 | 45.70 | −0.10 | 292 | 62 |
| SP500 до отсечки (скользящая фальш.) | 0.07 | 0.81 | 69.55 | −0.16 | 8 460 | 42 |
| SP500 после отсечки (скользящая фальш.) | −17.07 | 17.18 | 42.19 | −0.02 | 302 | 33 |
| SP500 до фальш. отсечки (1990–2008) | 0.27 | 1.39 | 59.32 | 0.01 | 2 528 | 0 |
| SP500 после фальш. отсечки (1990–2008) | 0.13 | 0.67 | 74.44 | −0.10 | 2 262 | 0 |
| SP500 до фальш. отсечки (2009–2023) | −0.01 | 0.05 | 97.33 | −0.02 | 1 762 | 0 |
| SP500 после фальш. отсечки (2009–2023) | −0.01 | 0.03 | 98.10 | 0.00 | 1 946 | 3 |
| Ряд | Корреляция: скользящее окно | Корреляция: SMA | Roll−SMA | t-стат. |
|---|---|---|---|---|
| Модель 1: SFR-Embedding-Mistral | ||||
| Рост ВВП | −0.153 | −0.074 | −0.079 | −0.72 |
| Инфляция | 0.885 | 0.333 | 0.552 | 19.15 |
| 10-л. трежерис | 0.965 | 0.857 | 0.108 | 15.69 |
| Безработица | 0.926 | 0.385 | 0.541 | 22.25 |
| Модель 2: nomic-embed-text-v1.5 | ||||
| Рост ВВП | −0.136 | −0.074 | −0.062 | −0.58 |
| Инфляция | 0.810 | 0.333 | 0.477 | 15.13 |
| 10-л. трежерис | 0.954 | 0.857 | 0.097 | 14.72 |
| Безработица | 0.866 | 0.385 | 0.481 | 17.14 |
| Модель 3: all-MiniLM-L6-v2 | ||||
| Рост ВВП | −0.143 | −0.074 | −0.069 | −0.66 |
| Инфляция | 0.818 | 0.333 | 0.485 | 15.94 |
| 10-л. трежерис | 0.951 | 0.857 | 0.094 | 12.34 |
| Безработица | 0.869 | 0.385 | 0.484 | 17.85 |
| Панель A: Точность инверсии | Фальш. даты | Фальш. значения | Реальные промпты |
|---|---|---|---|
| Steps = 5, Width = 1 | 0.028 | 0.028 | 0.056 |
| Steps = 10, Width = 1 | 0.056 | 0.069 | 0.083 |
| Steps = 15, Width = 1 | 0.056 | 0.069 | 0.097 |
| Steps = 5, Width = 4 | 0.222 | 0.236 | 0.292 |
| Steps = 10, Width = 4 | 0.375 | 0.333 | 0.361 |
| Steps = 15, Width = 4 | 0.403 | 0.375 | 0.389 |
| Панель B: Точность даты | Фальш. даты | Фальш. значения | Реальные промпты |
|---|---|---|---|
| Steps = 5, Width = 1 | 0.097 | 0.236 | 0.264 |
| Steps = 10, Width = 1 | 0.125 | 0.306 | 0.375 |
| Steps = 15, Width = 1 | 0.111 | 0.222 | 0.333 |
| Steps = 5, Width = 4 | 0.472 | 0.528 | 0.625 |
| Steps = 10, Width = 4 | 0.542 | 0.583 | 0.681 |
| Steps = 15, Width = 4 | 0.569 | 0.583 | 0.639 |
| Панель C: Средняя разница цен | Фальш. даты | Фальш. значения | Реальные промпты |
|---|---|---|---|
| Steps = 5, Width = 1 | 2.203 | 1.208 | 0.567 |
| Steps = 10, Width = 1 | 0.800 | 0.529 | 0.558 |
| Steps = 15, Width = 1 | 0.574 | 0.648 | 0.385 |
| Steps = 5, Width = 4 | 0.277 | 0.328 | 0.345 |
| Steps = 10, Width = 4 | 0.215 | 0.310 | 0.185 |
| Steps = 15, Width = 4 | 0.202 | 0.241 | 0.203 |
| Макроиндикатор | ME (%) | MAE (%) | Порог. точн. (%) | Направл. точн. (%) | Калибровка увер. | Начало | Конец | Num Obs | Отказы |
|---|---|---|---|---|---|---|---|---|---|
| До отсечки | |||||||||
| Еврозона, инфляция HICP | 0.02 | 0.06 | 96.57 | 95.00 | −0.25 | 01/1997 | 09/2023 | 321 | 2 |
| Великобритания, инфляция CPIH | −0.05 | 0.36 | 85.15 | 86.10 | −0.48 | 01/1990 | 09/2023 | 404 | 13 |
| Япония, инфляция CPI | 0.02 | 0.24 | 98.77 | 86.78 | −0.41 | 01/1990 | 09/2023 | 405 | 22 |
| Китай, инфляция CPI | 0.06 | 0.58 | 97.28 | 95.53 | −0.35 | 01/1990 | 09/2023 | 405 | 11 |
| После отсечки | |||||||||
| Еврозона, инфляция HICP | 2.03 | 2.03 | 35.29 | 37.50 | −0.08 | 10/2023 | 02/2025 | 17 | 0 |
| Великобритания, инфляция CPIH | 1.89 | 2.03 | 100.00 | 56.25 | 0.69 | 10/2023 | 02/2025 | 17 | 0 |
| Япония, инфляция CPI | 0.26 | 0.62 | 64.71 | 62.50 | — | 10/2023 | 02/2025 | 17 | 0 |
| Китай, инфляция CPI | 0.89 | 1.02 | 100.00 | 56.25 | −0.29 | 10/2023 | 02/2025 | 17 | 0 |
| До отсечки | |||||||||
| Еврозона, безработица | −0.23 | 0.24 | 100.00 | 85.56 | −0.58 | 01/2000 | 09/2023 | 285 | 0 |
| Великобритания, безработица | −0.03 | 0.15 | 96.54 | 92.57 | −0.24 | 01/1990 | 09/2023 | 405 | 0 |
| Япония, безработица | 0.01 | 0.06 | 98.75 | 93.47 | −0.07 | 01/1990 | 09/2023 | 399 | 0 |
| Китай, безработица | 0.04 | 0.07 | 89.95 | 84.62 | −0.21 | 01/1990 | 09/2023 | 378 | 27 |
| После отсечки | |||||||||
| Еврозона, безработица | 0.06 | 0.11 | 100.00 | 75.00 | −0.16 | 10/2023 | 02/2025 | 17 | 0 |
| Великобритания, безработица | −0.12 | 0.21 | 58.82 | 75.00 | −0.48 | 10/2023 | 02/2025 | 17 | 0 |
| Япония, безработица | 0.09 | 0.09 | 100.00 | 56.25 | 0.64 | 10/2023 | 02/2025 | 17 | 0 |
| Китай, безработица | 0.05 | 0.09 | 100.00 | 62.50 | — | 10/2023 | 02/2025 | 17 | 0 |
| MPE (%) | MAPE (%) | Направл. точн. (%) | Калибровка увер. | Начало | Конец | Num Obs | Отказы | |
|---|---|---|---|---|---|---|---|---|
| До отсечки | ||||||||
| Euro STOXX 50 | −6.22 | 10.53 | 84.17 | −0.92 | 01/1990 | 09/2023 | 361 | 44 |
| Nikkei 225 | −0.11 | 1.55 | 97.52 | −0.22 | 01/1990 | 09/2023 | 404 | 1 |
| FTSE 100 | 0.09 | 1.22 | 97.77 | −0.37 | 01/1990 | 09/2023 | 405 | 0 |
| SSE Composite | −3.27 | 6.68 | 81.42 | −0.19 | 12/1990 | 09/2023 | 394 | 0 |
| После отсечки | ||||||||
| Euro STOXX 50 | −27.21 | 27.54 | 46.67 | −0.79 | 10/2023 | 02/2025 | 16 | 1 |
| Nikkei 225 | −32.77 | 32.77 | 43.75 | −0.86 | 10/2023 | 02/2025 | 17 | 0 |
| FTSE 100 | −23.27 | 23.43 | 50.00 | −0.73 | 10/2023 | 02/2025 | 17 | 0 |
| SSE Composite | −9.81 | 18.23 | 40.00 | −0.61 | 10/2023 | 02/2025 | 16 | 1 |
| MPE (%) | MAPE (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Отказы | |
|---|---|---|---|---|---|---|
| Панель A: Без контекста | ||||||
| SP500 | −1.92 | 2.76 | 74.26 | −0.32 | 8 502 | 0 |
| SP500 после отсечки | −15.10 | 15.30 | 43.06 | 0.10 | 354 | 0 |
| Панель B: С контекстом | ||||||
| SP500 | 0.03 | 1.10 | 48.54 | −0.06 | 8 502 | 0 |
| SP500 после отсечки | 0.09 | 0.74 | 51.84 | −0.10 | 354 | 0 |
| Панель A: Ставки | ME (%) | MAE (%) | Порог. точн. (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Отказы |
|---|---|---|---|---|---|---|---|
| До отсечки, 01/1990 — 11/2023 | |||||||
| Рост ВВП | 0.07 | 0.48 | 92.59 | 91.04 | −0.11 | 135 | 1 |
| Инфляция | −0.15 | 0.39 | 91.87 | 66.67 | −0.24 | 406 | 1 |
| Безработица | −0.03 | 0.06 | 99.26 | 76.49 | −0.17 | 405 | 2 |
| 10-л. трежерис | 0.02 | 0.13 | 97.24 | 81.61 | −0.34 | 398 | 9 |
| После отсечки, 12/2023 — 02/2025 | |||||||
| Рост ВВП | −0.13 | 1.04 | 60.00 | 100.00 | −0.02 | 5 | 0 |
| Инфляция | −0.72 | 0.88 | 66.67 | 71.43 | −0.38 | 15 | 0 |
| Безработица | −0.14 | 0.14 | 75.00 | 27.27 | −0.33 | 12 | 3 |
| 10-л. трежерис | 0.21 | 0.38 | 64.29 | 69.23 | 0.33 | 14 | 1 |
| Панель B: Уровни | MPE (%) | MAPE (%) | Порог. точн. (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Отказы |
|---|---|---|---|---|---|---|---|
| До отсечки, 01/1990 — 11/2023 | |||||||
| VIX | 0.99 | 12.12 | 89.45 | 75.82 | −0.23 | 398 | 9 |
| Закладки домов | −2.29 | 5.51 | 90.27 | 74.25 | −0.36 | 401 | 6 |
| Nonfarm Payrolls | 42.85 | 208.61 | 86.67 | 84.90 | −0.11 | 405 | 2 |
| Недавний период до отсечки, 12/2014 — 11/2023 | |||||||
| VIX | 1.68 | 7.58 | 91.51 | 87.62 | −0.11 | 106 | 2 |
| Закладки домов | −1.54 | 3.37 | 91.51 | 81.90 | −0.11 | 106 | 2 |
| Nonfarm Payrolls | −6.09 | 9.50 | 98.13 | 98.11 | 0.03 | 107 | 1 |
| После отсечки, 12/2023 — 02/2025 | |||||||
| VIX | 15.31 | 20.70 | 37.50 | 57.14 | 0.14 | 8 | 7 |
| Закладки домов | −0.78 | 3.84 | 86.67 | 92.86 | 0.43 | 15 | 0 |
| Nonfarm Payrolls | 207.67 | 222.88 | 42.86 | 76.92 | −0.16 | 15 | 0 |
| Панель A: Числовые тесты | MPE (%) | MAPE (%) | Направл. точн. (%) | Калибровка увер. | Num Obs | Отказы |
|---|---|---|---|---|---|---|
| Дневные уровни: до отсечки, 02.01.1990 — 30.11.2023 | ||||||
| SP500 | −0.19 | 2.03 | 60.57 | −0.15 | 8 545 | 0 |
| DJIA | 0.03 | 1.97 | 61.01 | −0.41 | 8 487 | 58 |
| Nasdaq Composite | −0.28 | 4.48 | 58.05 | −0.26 | 8 545 | 0 |
| Дневные уровни: после отсечки, 01.12.2023 — 28.02.2025 | ||||||
| SP500 | −14.65 | 14.74 | 43.96 | — | 92 | 234 |
| DJIA | 10.76 | 18.08 | 58.82 | — | 69 | 266 |
| Nasdaq Composite | −14.10 | 14.51 | 45.05 | — | 92 | 219 |
| Дневные уровни: до отсечки с контекстом, 02.01.1990 — 30.11.2023 | ||||||
| SP500 | 0.12 | 0.96 | 52.31 | −0.07 | 8 544 | 1 |
| DJIA | 0.09 | 0.93 | 51.28 | −0.08 | 8 544 | 1 |
| Nasdaq Composite | 0.15 | 1.27 | 53.76 | −0.06 | 8 545 | 0 |
| Дневные уровни: после отсечки с контекстом, 01.12.2023 — 28.02.2025 | ||||||
| SP500 | 0.05 | 0.81 | 50.32 | −0.11 | 309 | 2 |
| DJIA | 0.06 | 0.69 | 52.43 | −0.13 | 310 | 1 |
| Nasdaq Composite | 0.13 | 1.15 | 52.43 | −0.09 | 310 | 1 |
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Рисунок недоступен для встраивания — смотреть в оригинале
Приложение C. Доказательство проблемы запоминания
C.1. Формальные определения и предположения
Пусть $\Phi$ — пространство всех возможных параметров модели для фиксированной архитектуры и обучающего конвейера.
- Произвольные параметры ($\phi$): $\phi \in \Phi$ — произвольный заполнитель для набора параметров модели.
- Фактические параметры ($\theta$): $\theta = \theta(I_{\mathrm{all}}) \in \Phi$ — фактические параметры полностью обученной модели, видевшей всю информацию $I_{\mathrm{all}}$.
- Контрфактические параметры ($\theta_t$): $\theta_t = \theta(I_t) \in \Phi$ — идеальные, но ненаблюдаемые контрфактические параметры, которые получились бы при обучении на ограниченном информационном множестве $I_t$.
Пусть $\mathcal{Y}$ — конечное непустое множество возможных ответов.
- Задача: $Q_t$ — задача, поставленная «по состоянию на момент $t$».
- Дополнительные инструкции: $P$ — дополнительные инструкции, модифицирующие задачу (например, ограничивающие промпты). $P = \varnothing$ означает отсутствие дополнительных инструкций сверх самой задачи.
- Оценочная функция: $S_\phi(y; Q, P)$ — внутренняя оценка модели для ответа $y \in \mathcal{Y}$ при параметрах $\phi$, задаче $Q$ и дополнительных инструкциях $P$.
- Решающее правило ($\delta$): детерминированное решающее правило модели: \[ \delta_\phi(Q, P) := \operatorname*{argmax}_{y \in \mathcal{Y}} S_\phi(y; Q, P). \] Предполагаем фиксированное детерминированное правило разрешения ничьих (например, лексикографическое), чтобы $\delta$ была корректно определённой функцией. Выбор правила разрешения ничьих не влияет на результат неидентифицируемости.
С этими определениями сформулируем ключевые величины:
- Идеальный эстиманд (цель): $Y_t^\star := \delta_{\theta_t}(Q_t, \varnothing)$
- Наблюдаемое ограниченное решение: $Y_{\mathrm{constrained}}(P) := \delta_{\theta}(Q_t, P)$
Наконец, сформулируем мягкое предположение, необходимое для конструкции доказательства.
Предположение 1 (достижимость решений). Для любой задачи $Q$ и неограниченного случая $P = \varnothing$, для каждой метки $y \in \mathcal{Y}$ существует параметр $\phi_y \in \Phi$ такой, что $\delta_{\phi_y}(Q, \varnothing) = y$.18
C.2. Каркас «промпт как оператор»
Проблема идентификации возникает потому, что дополнительные инструкции $P$ не меняют фактические параметры модели $\theta$. Вместо этого они действуют как неизвестный внутренний оператор, сдвигающий то, какие части параметрического пространства управляют выходом. Для каждого набора дополнительных инструкций $P$ и задачи $Q$ можно определить эффективное отображение параметров $T_{P,Q} : \Phi \to \Phi$ такое, что
\[ \delta_\theta(Q, P) = \delta_{T_{P,Q}(\theta)}(Q, \varnothing). \]Это определение: по предположению 1 для любого наблюдаемого выхода $y = \delta_\theta(Q, P)$ существует некоторое $\phi_y$ такое, что $\delta_{\phi_y}(Q, \varnothing) = y$, так что мы просто определяем $T_{P,Q}(\theta) := \phi_y$. Это улавливает наблюдаемое поведение: промпт $P$ даёт тот же выход, что и некоторый эффективный набор параметров $T_{P,Q}(\theta)$ без промпта. Промпт не меняет веса модели, но модулирует то, как эти веса используются для генерации выходов. Ключевым образом, мы не накладываем никакой априорной структуры, связывающей этот неизвестный оператор $T_{P,Q}$ с целевым контрфактом $\theta_t$, — именно это ведёт к неидентифицируемости.
Почему не предположить, что промпт работает? Можно возразить: «А что если ограничивающий промпт действительно достигает своей цели?» Это потребовало бы предположения $T_{P_{\mathrm{constraint}},Q_t}(\theta) = \theta_t$ — что промпт идеально преобразует фактические параметры в контрфактические. Однако это предположение эмпирически неверифицируемо без «белого ящика» (прямого наблюдения внутренних вычислений модели и представлений параметров). Непрозрачный процесс принятия решений моделью делает невозможным подтвердить, действительно ли промпт ограничивает модель информацией до $t$, или знание после $t$ остаётся встроенным и влияет на выходы необнаружимыми способами (например, через опору модели на запомненные исторические убеждения для симуляции ответов, уместных для эпохи). Наш агностический каркас отражает это эпистемическое ограничение: без верифицируемых свидетельств мы не можем идентифицировать, какой из многих наблюдательно эквивалентных процессов породил выход.
C.3. Неидентифицируемость идеального эстиманда
Этот каркас ведёт к общему результату неидентифицируемости.
Предложение 1 (неидентифицируемость). Зафиксируем $Q_t$ и ограничивающий промпт $P$. Пусть мы наблюдаем ограниченное решение $Y_{\mathrm{constrained}}(P) = y \in \mathcal{Y}$. Тогда для любых двух различных меток $y^\star, y^\dagger \in \mathcal{Y}$ существуют два порождающих данные мира $\mathcal{W}^\star$ и $\mathcal{W}^\dagger$ такие, что:
- Они дают одно и то же наблюдаемое при одних и тех же фактических параметрах $\theta$: \[ \delta_\theta(Q_t, P) = y. \]
- Они расходятся в целевом эстиманде: \[ \delta_{\theta_t^{(\star)}}(Q_t, \varnothing) = y^\star \quad\text{и}\quad \delta_{\theta_t^{(\dagger)}}(Q_t, \varnothing) = y^\dagger. \]
Доказательство. Строим два мира $\mathcal{W}^\star$ и $\mathcal{W}^\dagger$, дающих идентичные наблюдаемые, но различающихся в целевом эстиманде.
Общее наблюдаемое. По предположению 1 выберем $\tilde\theta := \phi_y$ такое, что $\delta_{\tilde\theta}(Q_t, \varnothing) = y$. Оба мира разделяют одни и те же фактические параметры $\theta$ и один и тот же промптовый оператор $T_{P,Q_t}$, определённый через $T_{P,Q_t}(\theta) = \tilde\theta$. Это гарантирует совпадение наблюдаемого в обоих мирах:
\[ \delta_\theta(Q_t, P) = \delta_{T_{P,Q_t}(\theta)}(Q_t, \varnothing) = \delta_{\tilde\theta}(Q_t, \varnothing) = y. \]Различные контрфакты. Миры различаются только в своих ненаблюдаемых контрфактических параметрах $\theta_t$. По предположению 1 полагаем:
- В $\mathcal{W}^\star$: $\theta_t^{(\star)} = \phi_{y^\star}$, так что $Y_t^\star = \delta_{\theta_t^{(\star)}}(Q_t, \varnothing) = y^\star$.
- В $\mathcal{W}^\dagger$: $\theta_t^{(\dagger)} = \phi_{y^\dagger}$, так что $Y_t^\star = \delta_{\theta_t^{(\dagger)}}(Q_t, \varnothing) = y^\dagger$.
Поскольку $y^\star \ne y^\dagger$ и оба мира согласуются с наблюдаемыми данными, целевой эстиманд $Y_t^\star$ не идентифицирован. $\blacksquare$
У этого предложения есть сильное следствие: в этой агностической модели наблюдение любого выхода даёт нулевую информацию о $Y_t^\star$.
Следствие 1 (резкая неидентифицируемость). При предположении 1 и операторной модели для любого наблюдаемого выхода $Y_{\mathrm{constrained}}(P) = y$ идентифицированное множество для $Y_t^\star$ равно всему множеству меток:
\[ \mathcal{I}(y) = \mathcal{Y}. \]Доказательство. Для любого $\bar y \in \mathcal{Y}$ конструкция из предложения 1 с $y^\star = \bar y$ показывает, что мир, где $Y_t^\star = \bar y$, наблюдательно эквивалентен наблюдаемым данным $y$. Значит, $\mathcal{I}(y) = \mathcal{Y}$. $\blacksquare$
C.4. Граничные случаи и обобщения
Когда проблема исчезает (будуще-инвариантные задачи). Проблема неидентифицируемости возникает потому, что ответ на $Q_t$ чувствителен к информации после $t$. Если задача «будуще-инвариантна», проблемы не существует. Формально: если для данной задачи $Q_t$ и разбиения информации в момент $t$ выполняется $\delta_{\theta_t}(Q_t, \varnothing) = \delta_{\theta}(Q_t, \varnothing)$, то $Y_t^\star$ равен фактическому решению $\delta_\theta(Q_t, \varnothing)$ и тривиально идентифицирован. Однако, как обсуждалось в разделе 2, задачи, требующие суждения, выбора или предсказания, как правило, не будуще-инвариантны, что ограничивает практическую применимость этого граничного случая.
Обобщение на стохастическое декодирование. Результат не артефакт argmax-декодирования (нулевой температуры). При стохастическом декодировании (температура > 0) та же неидентифицируемость сохраняется, наблюдаем ли мы полное предсказательное распределение $G_\theta(\cdot \mid Q, P)$ или выборки из него. Пусть $G_\phi(\cdot \mid Q, P)$ — предсказательное распределение над $\mathcal{Y}$, порождаемое параметрами $\phi$. Доказательство следует той же конструкции: для любых двух контрфактических распределений $G^*, G^\dagger$ над $\mathcal{Y}$ мы строим два мира с идентичными наблюдаемыми, расходящихся в цели. Это требует распределённого расширения предположения 1: для любого распределения $G$ над $\mathcal{Y}$ существуют параметры $\phi_G$ такие, что $G_{\phi_G}(\cdot \mid Q, \varnothing) = G$. Для нейросетей с softmax-выходами (стандартной архитектурой, переводящей оценки модели в вероятности) это предположение бесспорно: функция softmax $G(y) = \frac{e^{z_y}}{\sum_{y' \in \mathcal{Y}} e^{z_{y'}}}$ непрерывно отображает векторы оценок («логитов») $z \in \mathbb{R}^{|\mathcal{Y}|}$ на вероятностный симплекс. Поскольку $\mathcal{Y}$ конечно, любое целевое распределение $G$ реализуется подходящими значениями логитов (решением $|\mathcal{Y}| - 1$ независимых уравнений с $|\mathcal{Y}|$ параметрами). Для случая наблюдаемых выборок вместо полного распределения неидентифицируемость следует из простого аргумента об информативности: если наблюдение полного распределения $G_\theta(\cdot \mid Q, P)$ не идентифицирует $Y_t^\star$, то наблюдение конечных выборок, лишь частично раскрывающих это распределение, тем более не может.
Множественные или адаптивные промпты. Результат о невозможности не ограничен одиночными промптами. Наблюдение выходов любой последовательности пар «запрос–промпт» $\{(Q^{(k)}, P^{(k)})\}_{k=1}^K$ (даже выбираемых адаптивно на основе более ранних ответов) не идентифицирует $Y_t^\star$, поскольку конструкция предложения 1 применяется независимо к каждому наблюдению последовательности.
Процедуры маскирования и валидное маскирование. Определение 2 требует двух условий валидного маскирования. Условие (i) (будущая инвариантность) требует и эмпирической, и теоретической компонент.
Эмпирическая компонента: тесты реконструкции. Пусть $R_\theta : \mathcal{Q} \to \mathcal{I}$ — функция реконструкции, пытающаяся восстановить идентифицирующую информацию из замаскированной задачи, где $\mathcal{Q}$ — пространство задач, а $\mathcal{I}$ — пространство идентификаторов сущностей (названия компаний, даты, отрасли). Для замаскированной задачи $Q_t^{\mathrm{mask}}$: если модель успешно реконструирует идентификатор сущности с ненулевой вероятностью — формально, если $\Pr[R_\theta(Q_t^{\mathrm{mask}}) = I_{\mathrm{true}}] > \epsilon$ для некоторого порога $\epsilon > 0$, — это окончательно доказывает нарушение условия (i): замаскированный вход содержит достаточно информации для запуска сущность-специфичного запоминания. Однако неудача реконструкции ($\Pr[R_\theta(Q_t^{\mathrm{mask}}) = I_{\mathrm{true}}] \le \epsilon$) не доказывает, что условие (i) выполняется.
Формально: пусть $\mathcal{C}$ — множество всех возможных каналов, через которые $Q_t^{\mathrm{mask}}$ может запустить доступ к $I_{>t}$. Будущая инвариантность требует, чтобы для каждого канала $c \in \mathcal{C}$ решение $\delta_\theta(Q_t^{\mathrm{mask}}, \varnothing)$ не зависело от $I_{>t}$ через этот канал. Тесты реконструкции прощупывают лишь конечное подмножество $\{c_1, \ldots, c_k\} \subset \mathcal{C}$ потенциальных путей реконструкции. По замечанию 1 отрицательные свидетельства не доказывают отсутствия каналов запоминания.
Теоретическая компонента. Требуется аргументировать, что не существует информационного пути к запуску сущность-специфичных запомненных исходов. Для генерических/статистических задач, где лежащая в основе связь стабильна во времени (например, реакция рынка на сюрпризы отчётности), исследователи могут аргументировать: даже если модель идентифицировала сущность, ответ не изменится, потому что паттерн времени-инвариантен.
Условие (ii) (обнаружимый навык) адресует отдельную проблему идентификации. Без наблюдения того, что модель превосходит бейзлайн, слабая результативность может отражать либо (a) отсутствие способности модели, либо (b) чрезмерно агрессивное маскирование, удалившее информацию, необходимую для задачи. Эти альтернативы наблюдательно эквивалентны, создавая проблему неидентифицируемости, аналогичную предложению 1. Требование $p_{\mathrm{mask}} > p_0$ разрешает её: превосходство над бейзлайном устанавливает и наличие способности у модели, и сохранение маскированием достаточной информации.
Валидное маскирование допускает два исследовательских применения. Маскирование с сохранением задачи имеет место, когда $\delta_\theta(Q_t^{\mathrm{mask}}, \varnothing) = Y_t^\star = \delta_{\theta_t}(Q_t, \varnothing)$ — восстанавливается исходная исследовательская цель. Маскирование для демонстрации способности имеет место, когда замаскированная задача представляет смену эстиманда; это валидирует способность модели на классе замаскированных задач, но не позволяет сущность-специфичный вывод по исходной задаче.
C.5. Доказательство предложения 2: статистическая неразличимость в сравнениях до/после отсечки
Постановка и предположения. Пусть $n_{\mathrm{pre}}$ и $n_{\mathrm{post}}$ — размеры выборок до и после отсечки соответственно. Предполагаем:
- Независимость: выборки до и после отсечки берутся независимо.
- Асимметрия размеров: $n_{\mathrm{pre}} \gg n_{\mathrm{post}}$ (как обычно на практике).
Пусть $p_{\mathrm{pre}} = \Pr[\delta_\theta(Q_t, \varnothing) = Y_{\mathrm{true}} \mid t < t_{\mathrm{cutoff}}]$ и $p_{\mathrm{post}} = \Pr[\delta_\theta(Q_t, \varnothing) = Y_{\mathrm{true}} \mid t \ge t_{\mathrm{cutoff}}]$ — истинные точности модели на данных до и после отсечки, где $t_{\mathrm{cutoff}}$ — дата отсечки знаний модели, а $Y_{\mathrm{true}}$ — реализованный исход. Определим истинный разрыв запоминания $\Delta := p_{\mathrm{pre}} - p_{\mathrm{post}}$. Пусть $\hat p_{\mathrm{pre}}$ и $\hat p_{\mathrm{post}}$ — соответствующие выборочные оценки.
Предложение 2 (статистическая неразличимость в сравнениях до/после отсечки). Рассмотрим проверку $H_0 : \Delta = 0$, где $\Delta := p_{\mathrm{pre}} - p_{\mathrm{post}}$. Когда $n_{\mathrm{pre}} \gg n_{\mathrm{post}}$, стандартная ошибка оценённого разрыва $\hat\Delta = \hat p_{\mathrm{pre}} - \hat p_{\mathrm{post}}$ приблизительно равна
\[ \mathrm{SE}(\hat\Delta) \approx \sqrt{\frac{p_{\mathrm{post}}(1 - p_{\mathrm{post}})}{n_{\mathrm{post}}}} = O(n_{\mathrm{post}}^{-1/2}). \]Существуют два порождающих данные процесса, которые не могут быть надёжно различены обычными тестами гипотез:
- Времени-инвариантная способность: истинный разрыв равен нулю: $\Delta = 0$.
- Необнаруженное запоминание: истинный разрыв положителен, но мал: $\Delta > 0$ с $\Delta/\mathrm{SE}(\hat\Delta) = c$ для некоторой малой константы $c = O(1)$.
Для достаточно малого $c$ тесты гипотез будут иметь низкую мощность обнаружения таких разрывов. Когда $n_{\mathrm{post}}$ мало, экономически существенные разрывы запоминания остаются статистически необнаружимыми.
Доказательство предложения 2. Устанавливаем результат стандартным анализом мощности. Рассмотрим односторонний тест $H_0 : \Delta = 0$ против $H_1 : \Delta > 0$ по тестовой статистике $\hat\Delta = \hat p_{\mathrm{pre}} - \hat p_{\mathrm{post}}$. Односторонний тест уместен, поскольку запоминание теоретически предсказано завышать точность до отсечки (модель имеет доступ к информации об исходах для наблюдений до отсечки), откуда $\Delta \ge 0$; отрицательные разрывы ($\Delta < 0$) не согласуются с механизмом запоминания.
Истинная стандартная ошибка разности:
\[ \mathrm{SE}(\hat\Delta) = \sqrt{\frac{p_{\mathrm{pre}}(1 - p_{\mathrm{pre}})}{n_{\mathrm{pre}}} + \frac{p_{\mathrm{post}}(1 - p_{\mathrm{post}})}{n_{\mathrm{post}}}}. \]Когда $n_{\mathrm{pre}} \gg n_{\mathrm{post}}$ (как обычно на практике), первый член пренебрежим относительно второго, так что
\[ \mathrm{SE}(\hat\Delta) \approx \sqrt{\frac{p_{\mathrm{post}}(1 - p_{\mathrm{post}})}{n_{\mathrm{post}}}} = O(n_{\mathrm{post}}^{-1/2}). \]Заметим, что из-за этой асимметрии размеров выборок дисперсия $\hat\Delta$ доминируется дисперсией выборки после отсечки, что делает стандартную формулировку с объединённой дисперсией ненужной.
На практике истинная стандартная ошибка оценивается выборочными долями:
\[ \widehat{\mathrm{SE}}(\hat\Delta) = \sqrt{\frac{\hat p_{\mathrm{pre}}(1 - \hat p_{\mathrm{pre}})}{n_{\mathrm{pre}}} + \frac{\hat p_{\mathrm{post}}(1 - \hat p_{\mathrm{post}})}{n_{\mathrm{post}}}} \approx \sqrt{\frac{\hat p_{\mathrm{post}}(1 - \hat p_{\mathrm{post}})}{n_{\mathrm{post}}}}. \]По состоятельности $\widehat{\mathrm{SE}}(\hat\Delta) \xrightarrow{p} \mathrm{SE}(\hat\Delta)$ при $n_{\mathrm{post}} \to \infty$. Далее мы используем популяционную стандартную ошибку $\mathrm{SE}(\hat\Delta)$ для теоретических расчётов мощности (характеризующих предельное поведение теста), понимая, что практические тесты гипотез подставляют состоятельную оценку $\widehat{\mathrm{SE}}(\hat\Delta)$.
Анализ мощности. По стандартной асимптотической теории для двухвыборочных тестов долей, при альтернативной гипотезе с истинным разрывом $\Delta > 0$ тестовая статистика приблизительно распределена как
\[ \hat\Delta \sim N\big(\Delta,\; \mathrm{SE}^2(\hat\Delta)\big). \]Мощность отвержения $H_0$ на уровне значимости $\alpha$ зависит от стандартизированного размера эффекта $\Delta/\mathrm{SE}(\hat\Delta)$. Когда это отношение стремится к нулю, мощность стремится к $\alpha$ (тест не имеет мощности сверх доли ложноположительных). Конкретно, для одностороннего теста уровня $\alpha$ функция мощности приблизительно равна
\[ \mathrm{Power}(\Delta) = \Phi\!\left(\frac{\Delta}{\mathrm{SE}(\hat\Delta)} - z_{1-\alpha}\right), \]где $\Phi$ — функция распределения стандартного нормального закона, а $z_{1-\alpha}$ — критическое значение. Когда $\Delta/\mathrm{SE}(\hat\Delta) = c$ для малой константы $c = O(1)$, мощность низка.
Статистическая неразличимость. Рассмотрим два порождающих данные процесса с разными истинными параметрами:
- DGP 1 (времени-инвариантная способность): истинный разрыв равен нулю: $\Delta = 0$. Любая наблюдаемая разница — чисто выборочная вариация.
- DGP 2 (необнаруженное запоминание): истинный разрыв положителен со стандартизированным размером эффекта $\Delta/\mathrm{SE}(\hat\Delta) = c$ для некоторой малой положительной константы $c = O(1)$. Точность до отсечки завышена запоминанием.
Для достаточно малого $c$ (зависящего от уровня значимости $\alpha$ и желаемой мощности) стандартные тесты гипотез не могут отличить DGP 2 от DGP 1 с вероятностью, существенно превышающей долю ложноположительных $\alpha$. Оба DGP с высокой вероятностью дадут $p > \alpha$ («схожие результаты»).
Когда $n_{\mathrm{post}}$ мало, $\mathrm{SE}(\hat\Delta) = O(n_{\mathrm{post}}^{-1/2})$ велика. Любой истинный разрыв $\Delta$, удовлетворяющий $\Delta = c \cdot O(n_{\mathrm{post}}^{-1/2})$ для малого $c$, будет иметь низкий стандартизированный размер эффекта. Такие разрывы запоминания, которые могут быть существенными в абсолютном выражении (например, 5–10 процентных пунктов), остаются статистически необнаружимыми. Следовательно, наблюдение схожей точности до и после отсечки не даёт валидного вывода о том, обладает ли модель подлинным прогнозным навыком ($\Delta = 0$) или необнаруженным запоминанием ($\Delta > 0$). $\blacksquare$
Асимптотическая идентификация. При $n_{\mathrm{post}} \to \infty$ имеем $\mathrm{SE}(\hat\Delta) \to 0$, и множество необнаружимых разрывов сжимается к нулю. При достаточно большом $n_{\mathrm{post}}$ любой ненулевой разрыв $\Delta > 0$ становится обнаружимым с мощностью, стремящейся к 1.
C.6. Доказательство следствия 2: дообучение чёрным ящиком
Доказательство следствия 2. Рассмотрим процедуру дообучения чёрным ящиком $\mathcal{F} : \Phi \times \mathcal{D} \to \Phi$, принимающую исходные параметры $\theta = \theta(I_{\mathrm{all}})$ и «забывающий» датасет $D_{\mathrm{forget}}$ и дающую дообученные параметры $\theta_{\mathrm{ft}} = \mathcal{F}(\theta, D_{\mathrm{forget}})$. Мы наблюдаем выходы дообученной модели: $Y_{\mathrm{ft}} = \delta_{\theta_{\mathrm{ft}}}(Q_t, \varnothing)$.
Доказательство следует той же конструкции, что и предложение 1. Мы не накладываем априорной структуры, связывающей оператор чёрного ящика $\mathcal{F}$ с целевым контрфактом $\theta_t$. Этот агностицизм — источник неидентифицируемости.
Зафиксируем любой наблюдаемый выход $y_{\mathrm{ft}} \in \mathcal{Y}$ дообученной модели. По предположению 1 существует $\phi_{y_{\mathrm{ft}}} \in \Phi$ такое, что $\delta_{\phi_{y_{\mathrm{ft}}}}(Q_t, \varnothing) = y_{\mathrm{ft}}$.
Для любых двух различных меток $y^\star, y^\dagger \in \mathcal{Y}$ строим два наблюдательно эквивалентных мира:
- $\mathcal{W}^\star$ (подлинное забывание): полагаем истинные контрфактические параметры $\theta_t^{(\star)} = \phi_{y^\star}$, так что $Y_t^\star = \delta_{\theta_t^{(\star)}}(Q_t, \varnothing) = y^\star$. В этом мире процедура дообучения успешно удалила информацию после $t$ из параметров модели.
- $\mathcal{W}^\dagger$ (поведенческое подавление): полагаем истинные контрфактические параметры $\theta_t^{(\dagger)} = \phi_{y^\dagger}$, так что $Y_t^\star = \delta_{\theta_t^{(\dagger)}}(Q_t, \varnothing) = y^\dagger$. В этом мире процедура дообучения лишь модифицировала поверхностное поведение: $\theta_{\mathrm{ft}}$ по-прежнему содержит встроенную информацию после $t$, но модель научилась подавлять выходы, раскрывающие это знание.
В обоих мирах оператор дообучения $\mathcal{F}$ производит параметры такие, что $\delta_{\theta_{\mathrm{ft}}}(Q_t, \varnothing) = y_{\mathrm{ft}}$. Наблюдаемый выход идентичен, но интерпретации противоречат друг другу: подлинное забывание ($\mathcal{W}^\star$) против выученного подавления ($\mathcal{W}^\dagger$).
Поскольку $y^\star \ne y^\dagger$ и оба мира согласуются с наблюдаемыми данными, $Y_t^\star$ не идентифицируем из выходов дообученного чёрного ящика. Без верификации белым ящиком (например, техник механистической интерпретируемости, идентифицирующих и верифицирующих удаление конкретных вычислительных путей, кодирующих информацию после $t$) мы не можем различить, действительно ли модель забыла или лишь научилась скрывать своё знание. $\blacksquare$
Сноски
- После первоначального обучения модели обычно проходят обучение с подкреплением на основе человеческой обратной связи (RLHF) для повышения полезности и безопасности, но нет свидетельств, что этот процесс расширяет их временную линию знаний. ↩
- Пороговая точность измеряет процент правильных предсказаний того, превышает ли рост ВВП 2.5% — порог, выбранный для сбалансированной бинарной классификации (примерно 50% наблюдений в исторических данных выше этого порога). ↩
- «Великолепная семёрка» — семь заметных технологических компаний: Apple (AAPL), Amazon (AMZN), Alphabet/Google (GOOGL), Meta (META), Microsoft (MSFT), NVIDIA (NVDA) и Tesla (TSLA). ↩
- Эмбеддинги — высокоразмерные векторные представления, которые модель выучивает при обучении, чтобы располагать семантически близкие тексты рядом в векторном пространстве. Они извлекаются из внутренних представлений модели (токенных или пулированных предложенческих векторов) и могут дополнительно уточняться контрастивным обучением для улучшения сопоставления по семантическому сходству. ↩
- Из другой литературы, вскрывающей ограничения LLM: Ross, Kim, Lo (2024) применяют теорию полезности для оценки экономических смещений LLM, показывая, что экономическое поведение этих моделей ни полностью рационально, ни целиком человекоподобно. Далее, S. Chen et al. (2024) исследуют, как LLM прогнозируют доходности акций, находя человекоподобные поведенческие смещения (сверхэкстраполяция от недавней результативности) при лучшей, чем у людей, калибровке доверительных интервалов. ↩
- Мы фокусируемся на детерминированном (жадном) декодировании для ясности. Результаты обобщаются на стохастическое декодирование (температура > 0); см. приложение C. ↩
- Больше информации о модели: platform.openai.com/docs/models/gpt-4o. ↩
- Температура — параметр моделей ChatGPT, управляющий случайностью и креативностью ответов. Температура 0 по сути означает, что модель всегда выбирает слово с наивысшей вероятностью при условии текста, что устраняет эффект случайности в ответах и максимизирует воспроизводимость результатов. ↩
- Llama-3.1-70B-Instruct — 70-миллиардная инструкционно дообученная модель Llama-3.1 от Meta, выпущенная 23 июля 2024. Больше информации: huggingface.co/meta-llama/Llama-3.1-70B-Instruct. ↩
- Таблица A1 в приложении приводит сводные статистики данных как бенчмарк точности для сравнения способности модели воспроизводить значения с истинными данными. ↩
- Мы также тестируем альтернативные фальшивые отсечки знаний до 2005 и до 2015 годов для роста ВВП в таблицах A2 и A3 приложения и находим схожие паттерны. ↩
- Больше информации об эмбеддинг-модели: platform.openai.com/docs/models/text-embedding-3-large. ↩
- Схожий паттерн наблюдается при использовании расширяющегося окна. Рисунок A4 показывает сравнение с расширяющимися окнами и простой скользящей средней с 5-летним окном. Расширяющийся подход использует десять фолдов с зазором в один фолд между обучающими и тестовыми данными: для $n$-го фолда модель обучается на фолдах с 1 по $n$ и тестируется на фолде $n+1$. Кроме того, результаты значимо не меняются при силе регуляризации $\lambda = 0.001$ (рисунок A5) и $\lambda = 0.1$ (рисунок A6). ↩
- Мы используем 5-летнюю SMA как бенчмарк, поскольку при стандартной практике Ridge-регрессия на скользящем окне коллапсирует к среднему окна (SMA), когда предикторы не несут сигнала. ↩
- Мы находим схожие результаты для нескольких open-source эмбеддинг-моделей: (i) SFR-Embedding-Mistral, (ii) nomic-embed-text-v1.5, (iii) all-MiniLM-L6-v2 (см. таблицу A5 в приложении). ↩
- Мы повторяем этот тест с другими конфигурациями в таблице A6 и находим, что модель vec2text показывает схожие паттерны. ↩
- Llama-3.1-70B-Instruct — 70-миллиардная инструкционно дообученная модель Meta (выпущена 23 июля 2024) со 128K контекстом и мультиязычной поддержкой. Мы используем публично выпущенные веса под лицензией Llama 3.1 Community License (source-available). Дата отсечки знаний модели — декабрь 2023. ↩
- Это предположение чрезвычайно слабое. Для любой конкретной задачи доказательству требуется лишь его выполнение для конкретных меток, участвующих в контрфактическом сравнении. Для нейросетей с непрерывными высокоразмерными параметрическими пространствами и конечными множествами ответов это по сути бесспорно. ↩
Перевод выполнен с сохранением структуры, формул и данных оригинала. Оригинал: arXiv:2504.14765 · Lopez-Lira, Tang, Zhu (University of Florida) · CC BY-NC-ND 4.0.