The Limited Virtue of Complexity in a Noisy World

7.5/10

Álvaro Cartea · Qi Jin · Yuantao Shi · Oxford-Man Institute / связанная исследовательская сеть · апрель 2025

Оригинал: Cartea, Á., Jin, Q., Shi, Y. «The Limited Virtue of Complexity in a Noisy World», April 2025 — SSRN abstract_id=5202064.

Источники этой страницы. Текст опирается на (1) развёрнутую аннотацию статьи, опубликованную в Oxford-Man Institute Research Newsletter (апрель 2025) — это и есть содержание abstract работы; (2) краткое scrapbook-саммари той же статьи (dialidsantiago). Полный PDF с SSRN при подготовке страницы был недоступен из‑за блокировки Cloudflare; ниже нет теорем, формул закрытой формы и численных оценок, которых нет в этих источниках.

Оговорка по полноте. Страница — структурированный русский разбор опубликованной аннотации OMI и scrapbook-заметок, а не полный перевод рукописи. Утверждения о монотонности Sharpe и out-of-sample $R^2$, выпуклости по уровню шума, оптимальной сложности при частичной наблюдаемости и роли ridge / Random Matrix Theory взяты только из указанных источников.

Аннотация

Ошибка измерения в факторах влияет на out-of-sample результативность портфелей и на прогнозы доходностей. В высокоразмерном факторном пространстве увеличение сложности модели при надлежащей регуляризации может усиливать предсказуемость доходностей активов; однако коэффициент Шарпа портфеля активов и коэффициент детерминации $R^2$ прогноза доходностей монотонно убывают и являются выпуклыми по мере роста уровня шума в факторах. Далее показано: когда наблюдается лишь подмножество факторов, существует оптимальный уровень сложности, за которым включение дополнительных факторов ухудшает портфельную результативность из‑за шума в факторах. Таким образом, предельная выгода от роста сложности модели в какой‑то момент начинает убывать по мере увеличения числа наблюдаемых факторов. Находки подчёркивают ограниченную добродетель сложности в финансовом прогнозировании: результативность портфелей зависит от уровня шума в факторах, а более сложные модели не обязательно дают лучшую результативность, когда факторы наблюдаются несовершенно.

Ключевые слова: сложность модели; шум в факторах; ошибка измерения; ridge-регуляризация; Random Matrix Theory; out-of-sample $R^2$; Sharpe ratio; частичная наблюдаемость факторов; двойной спуск / перепараметризация; прогнозирование доходностей; портфельное таймирование.

1. Контекст и постановка

Современный спор о «добродетели сложности» в машинном обучении сталкивает две линии. Классический Occam’s razor предпочитает простые модели. Литература об overparameterized ML и явлении double descent, напротив, показывает режимы, в которых рост сложности (в том числе за пределами интерполяции) может улучшать обобщение — при подходящей архитектуре, данных и регуляризации.

Работа Cartea, Jin и Shi переносит этот спор в финансовую постановку прогноза избыточных доходностей. Каркас: много признаков (факторов), загрязнённых шумом. Источники загрязнения в scrapbook-саммари названы явно и типичны для квантовой практики: пропуски данных (data gaps), приближённые конструкции факторов (approximations), инфраструктурные и измерительные искажения. Иными словами, «фактор», попадающий в регрессию или в портфельный сигнал, — не «истинный» фактор, а noisy observation.

Центральный вопрос аннотации: как ошибка измерения в факторах бьёт по двум связанным, но разным объектам —

Метрики, которыми оценивается результативность (по scrapbook): Sharpe ratio тайминг-стратегии и out-of-sample $R^2$. Методологический каркас: ridge-регуляризация и аппарат Random Matrix Theory; отдельно рассматривается случай независимых истинных признаков (independent true features).

Постановка тем самым связывает три оси, которые в практике часто путают:

  1. Сложность — сколько факторов / признаков входит в модель (высокоразмерный факторный мир).
  2. Регуляризация — «надлежащая» (proper) регуляризация, без которой рост сложности не обещается улучшать предсказуемость.
  3. Качество наблюдения — уровень шума в факторах и полнота набора наблюдаемых факторов.

Аннотация OMI формулирует вывод уже в заголовке темы: добродетель сложности ограничена. Увеличение сложности может помогать, но только в режиме, где регуляризация и качество данных согласованы; при росте шума и при частичной наблюдаемости «больше признаков» перестаёт быть бесплатным улучшением.

2. Шум в факторах и out-of-sample метрики

Ключевой механизм — measurement error в факторах. Он влияет и на out-of-sample портфели, и на прогнозы доходностей. Это не просто «шум в целевой переменной»: искажены сами регрессоры / сигналы, по которым строится прогноз и портфель.

Для высокоразмерного факторного пространства аннотация разделяет два утверждения, которые важно не смешивать.

(A) Предсказуемость при регуляризации. Увеличение сложности модели при надлежащей регуляризации может усиливать предсказуемость доходностей активов. То есть в «чистом» или достаточно качественном режиме сложность не запрещена: она может помогать, если регуляризация контролирует оценку.

(B) Монотонный вред шума для Sharpe и $R^2$. Однако Sharpe ratio портфеля активов и $R^2$ прогноза доходностей убывают монотонно и являются выпуклыми по мере роста уровня шума в факторах. Формально (на языке аннотации, без дополнительных констант из PDF):

Интуитивно: шум в факторах — это не «просто дисперсия», которую можно «перебить» более богатой моделью. Он систематически ухудшает и статистическую точность прогноза ($R^2$), и экономическую метрику портфеля (Sharpe). Выпуклость подчёркивает нелинейность вреда: ухудшение по мере роста шума не выглядит как мягкая линейная поправка.

Связка с scrapbook: сложность помогает, когда есть регуляризация и высокое качество данных; при шуме / частичной наблюдаемости появляется оптимум сложности (см. разд. 4), а за ним добавление признаков вредит.

Практически это значит: диагностика «почему упал OOS Sharpe / $R^2$» должна включать не только переобучение модели, но и качество факторных входов. Даже «правильная» сложность не спасает, если measurement error в факторах высок: аннотация утверждает монотонное ухудшение обеих метрик по уровню шума.

3. Сложность, ridge-регуляризация и Random Matrix Theory

Scrapbook фиксирует технический каркас анализа: ridge + Random Matrix Theory, в постановке с независимыми истинными признаками. Аннотация OMI не воспроизводит конкретные теоремы рукописи, но задаёт смысловые опоры, которые согласуются с этим каркасом.

Зачем ridge. В высокоразмерном пространстве без регуляризации рост числа факторов легко превращается в неустойчивую оценку. «Proper regularization» в аннотации — условие, при котором увеличение сложности может усиливать предсказуемость. Ridge — естественный кандидат: он стабилизирует обращение выборочных ковариаций / грам-матриц признаков и даёт непрерывный параметр сложности/штрафа.

Зачем Random Matrix Theory. Когда число признаков сопоставимо с объёмом выборки, классическая асимптотика «фикс $p$, $n\to\infty$» не описывает спектр выборочных ковариаций. RMT даёт язык для поведения собственных значений и для того, как шум в признаках искажает оцениваемые направления. В контексте статьи это инструмент связать:

Независимые истинные признаки. Scrapbook отмечает анализ случая independent true features. Это упрощение, при котором можно яснее отделить эффект шума измерения от эффекта корреляции между факторами. Даже в таком «благоприятном» мире аннотация утверждает: рост шума монотонно и выпукло бьёт по Sharpe и $R^2$; а при неполной наблюдаемости — существует оптимум сложности.

Связь с double descent / overparameterized ML (из scrapbook): статья стоит на мосту между Occam’s razor и «virtue of complexity». Вывод не «сложность всегда вредна» и не «сложность всегда добродетельна». Вывод условный:

\[ \text{сложность помогает} \quad\Longleftrightarrow\quad \text{регуляризация уместна}\ \wedge\ \text{данные / факторы достаточно качественны}. \]

Когда качество наблюдения падает, добродетель сложности сужается — отсюда название работы.

Важно: на этой странице нет воспроизведения явных asymptotic rates, оптимальных значений параметра ridge или численных таблиц из PDF — их нет в OMI-аннотации и в scrapbook-саммари. Утверждается только качественная структура результата, зафиксированная в источниках.

4. Частичная наблюдаемость факторов

Второй крупный блок аннотации: наблюдается не весь факторный мир, а лишь подмножество факторов. Это ближе к практике, чем полный oracle-набор: исследователь видит конечный каталог характеристик / сигналов, а «истинные» драйверы доходностей могут быть шире и частично скрыты.

Утверждение аннотации:

То есть кривая «сложность → портфельный Sharpe / качество прогноза» при частичной наблюдаемости не обязана быть монотонно растущей. Есть зона, где добавление факторов ещё помогает (особенно при регуляризации), и зона, где новый фактор приносит больше measurement error, чем полезного сигнала.

Scrapbook формулирует тот же вывод короче: с шумом / partial observability есть optimal complexity; beyond that, more features hurt.

Это качественно отличает финансовую постановку от наивного переноса «double descent»: даже если в чистом ML-режиме сверхпараметризация иногда помогает, в мире noisy / partially observed factors «ещё один признак» может быть net-negative для портфеля. Оптимум — не максимум доступных факторов, а баланс между покрытием сигнала и накоплением шума.

Связь с монотонностью по уровню шума (разд. 2): при фиксированной сложности рост шума ухудшает Sharpe и $R^2$; при фиксированном (неидеальном) качестве наблюдения рост сложности сверх оптимума тоже ухудшает портфель. Обе оси — шум и размерность наблюдаемого набора — ограничивают добродетель сложности.

5. Выводы по источникам

Сводя OMI-аннотацию и scrapbook без добавления «лишней» теории:

  1. Measurement error в факторах материален. Он бьёт по out-of-sample портфелям и по прогнозам доходностей — это стартовая посылка аннотации, а не побочный эффект.
  2. Сложность не запрещена. В высокоразмерном пространстве при proper regularization рост сложности может усиливать предсказуемость доходностей.
  3. Шум монотонно вредит ключевым метрикам. Портфельный Sharpe и прогнозный $R^2$ убывают монотонно и выпукло с ростом уровня шума в факторах.
  4. При частичной наблюдаемости есть оптимум сложности. За ним добавление факторов ухудшает портфель из‑за шума; предельная выгода от сложности в итоге убывает с ростом числа наблюдаемых факторов.
  5. Итог для ML-нарратива. Работа соединяет Occam’s razor с литературой о перепараметризации / double descent и показывает: в шумном финансовом мире добродетель сложности ограничена качеством и полнотой факторных наблюдений.

Финальная формулировка аннотации: performance of portfolios зависит от noise level in factors; more complex models do not necessarily lead to better performance when factors are not perfectly observed.

6. Практический смысл для квантов и алготрейдинга

Ниже — следствия, которые прямо вытекают из источников (без численных порогов из PDF).

Сначала качество факторов, потом сложность модели. Если measurement error высок, аннотация предсказывает ухудшение и $R^2$, и Sharpe. Гонка за числом признаков при грязных входах — плохая ставка.

Регуляризация — условие, а не украшение. Положительный эффект сложности в аннотации связан с proper regularization. В scrapbook это конкретизируется через ridge (+ RMT-анализ).

Следить за двумя метриками вместе. Улучшение in-sample fit или даже локальное усиление предсказуемости не отменяет вопрос портфельного Sharpe. Аннотация явно держит обе оси: prediction $R^2$ и portfolio Sharpe.

Не путать «ещё один фактор доступен» с «нужно его включить». При partial observability существует оптимальная сложность; за ней дополнительные факторы вредят. Каталог признаков стоит наращивать с проверкой OOS Sharpe / $R^2$, а не по полноте покрытия.

Инфраструктурный шум тоже входит в модель. Scrapbook относит к загрязнению data gaps, approximations и infra. Очистка пайплайна факторов — часть моделирования сложности, а не «инженерная мелочь».

Ограничение страницы. Здесь нет калибровочных рецептов вида «берите $p^\star=$…» или «при SNR ниже …». Такие числа потребовали бы полного текста; при блокировке PDF страница намеренно остаётся на уровне опубликованной аннотации и scrapbook.

Источники этой страницы

Таблица. Что использовано и чего нет.
ИсточникРольЧто даёт
OMI Research Newsletter, April 2025 — abstract статьи Основной текст содержания abstract Measurement error; high-dimensional complexity + regularization; монотонность и выпуклость Sharpe и $R^2$ по шуму; оптимум сложности при subset of factors; limited virtue of complexity
dialidsantiago scrapbook summary Структурный конспект той же работы Мост Occam ↔ overparameterized ML / double descent; noisy features (gaps, approx, infra); метрики Sharpe timing + OOS $R^2$; ridge + RMT; independent true features; optimal complexity при noise / partial observability
SSRN 5202064 (полный PDF) Не использован Доступ к PDF при подготовке был заблокирован Cloudflare; теоремы, доказательства и численные таблицы из PDF на страницу не переносились

Любое расширение страницы (формулы, графики, таблицы) должно опираться на доступный полный текст или на новые первичные источники — не на домысел поверх аннотации.

Литература

  1. Cartea, Á., Jin, Q., and Shi, Y. (2025). The Limited Virtue of Complexity in a Noisy World. SSRN Working Paper, April 2025. papers.ssrn.com/sol3/papers.cfm?abstract_id=5202064 (abstract_id=5202064).
  2. Oxford-Man Institute of Quantitative Finance (2025). Research Newsletter, April 2025 — опубликованная аннотация работы Cartea, Jin, Shi (использована как содержание abstract на этой странице).
  3. dialidsantiago — scrapbook summary той же статьи: Occam vs double descent; noisy features; Sharpe + OOS $R^2$; ridge + Random Matrix Theory; optimal complexity under noise / partial observability.

Страница: русский разбор OMI-аннотации (апрель 2025) и scrapbook-саммари. Атрибуция: SSRN 5202064 · Cartea, Jin, Shi · «The Limited Virtue of Complexity in a Noisy World». Полный PDF при подготовке был недоступен (Cloudflare); утверждения ограничены опубликованной аннотацией и scrapbook. Оригинал: SSRN abstract_id=5202064.