Сравнительный анализ статистических и машинно-обучаемых моделей для поиска выбросов в лимитных стаканах биткоина

5.5/10

Иван Леттери · Department of Life, Health and Environmental Sciences, University of L’Aquila · 20 июля 2025

Оригинал: Letteri, I. «A Comparative Analysis of Statistical and Machine Learning Models for Outlier Detection in Bitcoin Limit Order Books», 2025 — arxiv.org/abs/2507.14960 (PDF).

Модуль AITA-OBS внутри фреймворка AITA; волатильностная нога — VolTS того же автора. Рисунки воспроизведены из оригинальной публикации. Оригинал распространяется по лицензии CC BY-NC-ND 4.0; перевод выполнен на её условиях для личной коллекции, изменение по отношению к оригиналу — перевод на русский язык. Рисунки приведены из оригинальной публикации.

Ключевые слова: лимитный стакан; алгоритмическая торговля; количественные финансы; машинное обучение; поиск аномалий; криптовалюты.

Аннотация

Поиск выбросов в криптовалютных лимитных стаканах важен для понимания динамики рынка — особенно при высокой волатильности и ещё не устоявшемся регулировании. Работа сравнивает робастные статистические методы и машинное обучение для «реального времени» идентификации аномалий в крипто-стаканах. В единой тестовой среде AITA Order Book Signal (AITA-OBS) оцениваются тринадцать моделей: какие из них лучше ловят потенциально манипулятивное поведение. Эмпирика — бэктест на 26 204 записях с крупной биржи. Лучшая модель, Empirical Covariance (EC), даёт прирост 6,70% и заметно обходит обычный Buy-and-Hold. Автор делает вывод, что стратегии на выбросах работают, и обсуждает обмен между сложностью модели, частотой сделок и результатом. Вклад — бенчмарк детекторов аномалий для микроструктуры крипторынка и намёк, что ими можно дополнить алготорговлю и риск-менеджмент.

1. Введение

Крипторынок отличают крайняя волатильность, резкие скачки ликвидности и относительно незрелая микроструктура по сравнению с акциями и облигациями [Koutmos, 2018]. Это делает его чувствительным к манипуляциям: spoofing, wash trading, layering — они искажают price discovery и бьют по целостности рынка [Fratrič et al., 2022]. При этом децентрализованная природа биткоина держит интерес розницы и институционалов, отсюда спрос на инструменты, которые ловят рыночные аномалии «на лету».

Недавние работы подчёркивают роль потока заявок — непрерывного потока покупок и продаж — в движении цены и ликвидности крипторынков [Apergis et al., 2021; Dimpfl and Peter, 2021]. Преобладающие подходы к выбросам в LOB часто не ловят высокочастотную нелинейную динамику и падают в экстремумах. Эта работа закрывает зазор сравнением широкого набора статистических и ML-моделей. Чтобы сравнение было честным и воспроизводимым, автор собрал AITA-OBS — единую тестовую среду. AITA-OBS — модуль приложения Artificial Intelligence Trading Assistant (AITA) [Letteri, 2023a]; рядом стоит Volatility Trading System (VolTS) [Letteri, 2023b], см. перевод VolTS.

Литература: Kercheval and Zhang [2015] — SVM для прогноза mid в стакане; Tadi and Kortchemski [2021] — коинтеграционные пары на крипте. Здесь модели от Empirical Covariance и HBOS до One-Class SVM и CBLOF сводятся в один бенчмарк.

Три вклада: (i) единый прозрачный бэктест AITA-OBS для детекторов аномалий в LOB; (ii) сравнение тринадцати статистических и ML-моделей; (iii) эмпирика с разбором транзакционных издержек, показывающая, что стратегия на выбросах может помочь алготорговле и портфельному риску. Лучшая модель обходит B&H на 6,70%.

Структура: §2 — фон и таксономия выбросов; §3 — данные, признаки, формулы моделей и конвейер «скор → сигнал»; §4 — бэктест; §5 — заключение.

2. Фон и связанные работы

2.1. Таксономия выбросов в лимитном стакане

Это классификация типов аномалий. Детекторы ниже — без учителя: они не размечены на spoofing/wash/layering. Связь «выброс = манипуляция» в работе остаётся гипотезой, которую проверяют косвенно через P&L контртрендовой стратегии, а не через метки регулятора.

2.2. Связанные работы

Микроструктура — процессы формирования цены, ликвидности и эффективности. Apergis et al. [2021] и Dimpfl and Peter [2021] показывают, что price discovery и поставка ликвидности на крипте расходятся с традиционными инструментами. Эти работы дают фон, но редко дают рабочий детектор аномалий на HFT-горизонте. Здесь статистика и ML заточены под высокочастотную динамику крипто-стакана.

Tadi and Kortchemski [2021] — динамические коинтеграционные пары на BitMEX: несмотря на ограничения микроструктуры, стратегия била наивный B&H. Cortez et al. [2021] сравнивали прогноз ликвидности крипты и фиата через ARMA, GARCH и KNN: ARMA лучше на развитых фиатных рынках, GARCH — на emerging. Kercheval and Zhang [2015] — SVM для mid и пересечения спреда в LOB.

Эта работа опирается на перечисленное, но фокус — связка статистики и ML именно для выбросов в потоке заявок биткоина.

3. Экспериментальный дизайн и методология

3.1. Данные и признаки

AITA-OBS встроен в AITA [Letteri et al., 2023; 2022a]. Price Action кодируется как OHLC — открытие, максимум, минимум, закрытие — как на свечном графике (рис. 1). Для каждого бара $t$ OHLC актива — четырёхмерный вектор \[ X_t=(x_t^{(o)},x_t^{(h)},x_t^{(l)},x_t^{(c)})^{\top}, \] плюс объём $v_t$. Ограничения: $x_t^{(l)}\gt 0$, $x_t^{(l)}\lt x_t^{(h)}$ и $x_t^{(o)},x_t^{(c)}\in[x_t^{(l)},x_t^{(h)}]$.

Схема: тиковый путь цены сворачивается в OHLC-свечу с тенями и телом
Рис. 1. Пример свечного представления: high / open / close / low и верхняя/нижняя тень.

Признаки для детекции берутся из OHLC и слоёв стакана (bid и ask):

Выборка бэктеста — 18 дней, с 26 декабря 2024 по 13 января 2025, 26 204 записи на минутном баре с «крупной биржи» (имя не названо). Это не наносекундный стакан: горизонт — минута. Препроцессинг: нормализация, масштабирование и признаки из §3.1.

3.2. Модели поиска выбросов

Тринадцать моделей без учителя, статистика и ML.

3.2.1. Статистические

Пусть $X\in\mathbb{R}^{n\times p}$ — $n$ наблюдений, $p$ признаков. Параметрические методы предполагают многомерный гаусс или робастную оценку ковариации.

Elliptic Envelope (EE). Инлаеры лежат в эллипсе: робастные $\mu$ и $\Sigma$. Расстояние Махаланобиса \[ d_M(x_i)=\sqrt{(x_i-\mu)^{\top}\Sigma^{-1}(x_i-\mu)}. \] Выброс, если квадрат расстояния выше порога хи-квадрат: \[ \mathrm{label}_i=\begin{cases} 1,& d_M(x_i)^2\gt\chi^{2}_{p,1-\alpha},\\ 0,& \text{иначе.} \end{cases} \]

Minimum Covariance Determinant (MCD). Ищется подмножество из $h=\lfloor n\cdot(1-\alpha)\rfloor$ точек, у выборочной ковариации которого минимальный определитель [Hubert and Debruyne, 2010]: \[ (\mu_{\mathrm{MCD}},\Sigma_{\mathrm{MCD}})=\arg\min_{S\subseteq X:|S|=h}\det(\Sigma_S). \] Дальше то же пороговое правило, что у EE.

Empirical Covariance (EC). Классические выборочные среднее $\bar x$ и ковариация $\Sigma$, снова Махаланобис. Порог — перцентиль распределения расстояний (в тексте: 97,5-й).

HBOS (непараметрический). По каждому признаку строится гистограмма плотности. Скор точки — сумма обратных логарифмов плотностей при независимости признаков: \[ \mathrm{HBOS}(x)=\sum_{i=1}^{p}\log\frac{1}{\mathrm{density}_i(x_i)}. \] Выброс, если скор выше порога $\tau$.

3.2.2. ML без учителя

One-Class SVM. Граница, охватывающая большую часть данных [Nguyen and Vien, 2019]. Гиперплоскость максимально далеко от начала: \[ \min_{w,\rho,\xi}\ \tfrac12\|w\|^2+\frac{1}{\nu n}\sum_{i=1}^{n}\xi_i-\rho \] при $w\cdot\phi(x_i)\ge\rho-\xi_i$, $\xi_i\ge 0$; $\nu\in(0,1]$ задаёт долю выбросов. Ядро — RBF.

DBSCAN. Плотные сгустки — кластеры, одиночки в низкой плотности — выбросы. Параметры: радиус $\varepsilon$ и $\mathrm{minPts}$.

Isolation Forest. Случайный признак и случайный порог между min и max; среднее число разрезов по лесу — скор аномалии.

LOF [Breunig et al., 2000]. Отношение средней local reachability density соседей к собственной. Скор заметно больше 1 — выброс.

CBLOF. Скор от размера кластера и расстояния до его центроида.

K-Means. $k$ кластеров; далёкие от любого центроида точки — кандидаты. Критерий \[ J=\sum_{j=1}^{k}\sum_{x_i\in C_j}\|x_i-\mu_j\|^2. \]

OPTICS. Расширение DBSCAN без глобальной плотности: reachability-график, выбросы — точки с большой reachability distance.

SOD. Выбросы в подпространствах признаков; полезно в высокой размерности.

KNN. Скор — расстояние до $k$-го соседа; большие расстояния — аномалии.

Гиперпараметры подбирались grid search и кросс-валидацией по критериям табл. 1. Например, $\varepsilon$ и $\mathrm{minPts}$ у DBSCAN — под шоки ликвидности; $\nu$ у OC-SVM — чтобы снизить ложные срабатывания «манипуляций».

Таблица 1. Модели и заявленный контекст применения в стакане.
КлассМоделиСильные стороныЗаявка в LOB
ПараметрическиеEC, MCD, EEИнтерпретируемость, скоростьВыбросы объёма/спреда
НепараметрическиеHBOSБез распределенияВременны́е и ликвидные аномалии
ПлотностныеDBSCAN, OPTICSАдаптация к смене режимаШоки ликвидности, spoofing
Изоляция / близостьIsoF, LOF, KNNВысокая размерностьWash trading, шипы волатильности
КластеризацияK-Means, CBLOFСтруктурные сдвигиLayering, искусственная глубина

Таблица 1 — карта намерений, не результат разметки: ни одна модель не обучалась на известных spoofing/wash/layering метках.

3.3. От скора к торговому сигналу: конвейер AITA-OBS

Сырой выход — числовой anomaly score. Чтобы сравнить модели честно, один и тот же конвейер переводит скор в сделку.

3.3.1. Нормализация скора

Модель $M$ на точке $X_t$ даёт $s_M^{\mathrm{raw}}(X_t)$. Шкалы разные, поэтому Min-Max на всей выборке в $[0,1]$: \[ s_M(X_t)=\frac{s_M^{\mathrm{raw}}(X_t)-\min(S_M^{\mathrm{raw}})}{\max(S_M^{\mathrm{raw}})-\min(S_M^{\mathrm{raw}})}, \] где $S_M^{\mathrm{raw}}$ — все сырые скоры модели $M$. Это заглядывание вперёд: порог и шкала знают будущее. Для онлайнового «реального времени» из аннотации так делать нельзя; в бэктесте это завышает чистоту сравнения моделей между собой, но не даёт честной out-of-sample торговли.

3.3.2. Бинарный сигнал

$O_t\in\{0,1\}$. Динамический порог — 95-й перцентиль распределения скоров той же модели: \[ O_t=\begin{cases} 1,& s_M(X_t)\gt\tau_M,\\ 0,& \text{иначе,} \end{cases} \qquad \tau_M=P_{95}\bigl(\{s_M(X_t)\ \forall t\}\bigr). \] Перцентиль 95 выбран как компромисс: отфильтровать шум, но оставить достаточно событий для торговли. И этот порог тоже считается по всей выборке.

3.3.3. Логика сделки и протокол бэктеста

При $O_t=1$ открывается позиция.

Стартовый бюджет $B_0=1500$ (USD). Прибыль сделки — по изменению цены до следующего сигнала или закрытия бара. Итог — кумулятивная прибыль $P_T$ и процентный прирост $\%G$. Бенчмарк — Buy-and-Hold на том же окне.

4. Результаты бэктеста и обсуждение

Данные: 18 дней, 26 декабря 2024 — 13 января 2025, 26 204 минутных бара. Рис. 2 — дисбаланс bid/ask и импульс цены. Дисбаланс сильно гуляет в волатильные куски.

Дисбаланс bid/ask по минутам с 27 декабря 2024 по 13 января 2025, шипы до порядка ±20 000
Рис. 2. Изменчивость дисбаланса bid/ask (и импульс цены в оригинале) на окне оценки.

Симуляция. $B_0=1500$, $B_t$ — бюджет, $P_t$ — накопленная прибыль, $R_t$ — доходность шага; старт $B_t=B_0$, $P_t=0$, $R_t=0$. Если на шаге $t$ пойман выброс: (i) размер сделки $=0{,}3333\times B_{t-1}$; (ii) изменение цены $\Delta\%=(\mathrm{Close}(t-1)-\mathrm{Close}(t))/\mathrm{Close}(t-1)$; (iii) прибыль $=\mathrm{Amount}\times\Delta\%$; (iv) $B_t=B_{t-1}+\mathrm{Profit}$; (v) $P_t=B_t-B_0$; (vi) $R_t=\mathrm{Profit}/B_0$. Win rate $\mathrm{WR}=(\text{выигрышные}/\text{все сделки})\times 100$. B&H: \[ \text{B\&H Profit}=B_0\times\Bigl(1+\sum_{t=1}^{T}\mathrm{DR}(t)\Bigr)-B_0, \] где $\mathrm{DR}(t)$ — дневная доходность. Итог $P_T=B_T-B_0$, $\%G=(P_T/B_0)\times 100$.

Знак $\Delta\%$ записан как $(\mathrm{Close}(t-1)-\mathrm{Close}(t))/\mathrm{Close}(t-1)$ — это минус обычной простой доходности бара. Направление позиции (лонг/шорт против импульса) должно согласовывать этот знак с P&L; в тексте формулы это не расписано по веткам.

4.1. Статистические модели

Таблица 2. Статистические модели.
МодельЛонговШортовПрибыль, USDПрирост, %
EE6369−8,23−0,55
HBOS56272370,274,68
MCD347309−8,89−0,59
EC341315100,476,70

Empirical Covariance — лучшая статистика: 100,47 USD (6,70%). Кривая капитала (рис. 3) растёт ступеньками. HBOS тоже в плюсе (70,27 USD), но сделок много — выше потенциальные комиссии. MCD и EE в небольшом минусе.

Кривые капитала статистических моделей против цены BTC, старт 1500 USD
Рис. 3. Equity статистических моделей. Пунктир — дневной B&H (цена BTC, правая ось).

4.2. Машинное обучение

Таблица 3. Модели машинного обучения.
МодельЛонговШортовПрибыль, USDПрирост, %
CBLOF64966275,485,03
OPTICS192012,860,86
K-Means435444981,100,07
KNN67463771,794,79
OC-SVM716943,592,91
SOD1283133842,812,85
LOF12713660,344,02
IsoF13512812,840,86
DBSCAN878932,422,16

Среди ML лучший кумулятив у CBLOF: 75,48 USD (5,03%), но сделок почти вдвое больше, чем у EC. KNN рядом. OC-SVM: 43,59 USD (2,91%) при 140 сделках — выгоднее, если смотреть на издержки. K-Means даёт 8852 сделки на 26 204 барах: почти каждый бар, прирост 0,07% — детектор как торговый фильтр здесь не работает. Рис. 4 — equity ML-моделей.

Кривые капитала ML-моделей против цены BTC
Рис. 4. Equity моделей машинного обучения. Пунктир — дневной B&H.

4.3. Бенчмарк и издержки

EC — лучшая модель overall. CBLOF силён по прибыли, но частота сделок критична. Рис. 5 — прибыль на сделку: OPTICS и OC-SVM выигрывают по отношению прибыль/сделка; на рис. 5 лучший столбец подписан как OPT. EE и MCD в минусе на сделку.

Столбцы прибыли на сделку по моделям, лидер OPTICS
Рис. 5. Кумулятивная прибыль на одну сделку. Красный пунктир — лучшее отношение (OPTICS).

Кроме EE и MCD, все стратегии в плюсе. Лучшие заметно обходят B&H, который за окно потерял 37,06 USD. Это аргумент автора в пользу контртренда на выбросах на этом куске биткоина — не доказательство, что детектор ловит манипуляции.

Рис. 6 — оценка суммарных комиссий при maker-тарифе 0,08% на сделку. K-Means, CBLOF и KNN съедают прибыль частотой. EC и OC-SVM дешевле. Важно: таблицы 2–3, судя по тексту, не вычитают эти комиссии из $P_T$; рис. 6 — отдельная оценка. После 0,08% на сторону рейтинг по «грязному» P&L может разъехаться.

Суммарные комиссии по моделям, K-Means заметно выше остальных
Рис. 6. Оценка суммарных комиссий (maker 0,08% на сделку). K-Means — явный выброс по издержкам.

5. Заключение

Сравнение тринадцати статистических и ML-моделей для аномалий в стакане биткоина. Единая среда AITA-OBS переводит скор без учителя в контртрендовую сделку.

Простые робастные статистики оказались сильными. Empirical Covariance — лучшая стратегия: 6,70% при умеренном числе сделок. Среди ML CBLOF прибылен, но частота ставит вопрос об издержках; OC-SVM ближе к компромиссу прибыль/частота. Большинство детекторов с простой против-импульсной логикой обошли B&H на этом волатильном окне.

Автор предлагает работу как бенчмарк. Дальше: динамические пороги, ансамбли лучших моделей, другие цифровые активы и традиционные рынки. В «ближайшем будущем» — оптимизация [Letteri et al., 2020, 2021], API AITA как сервис против ботнетов на глубоком обучении [Letteri et al., 2019a,b], мультиагентная система с «этическими» агентами [Dyoub et al., 2020] и связка логических ограничений с DRL [Gasperis et al., 2023]. Это уже соседние проекты группы, не результат бэктеста стакана.

Оговорки, которые стоит держать рядом с 6,70%. Окно 18 дней, минута, одна неназванная биржа. Нормализация Min-Max и порог $P_{95}$ считаются по всей выборке — это не онлайн. Нет размеченных манипуляций: P&L контртренда не равен precision по spoofing. Комиссии в таблицах, по всей видимости, не вычтены. Заголовок говорит о limit order book, ряд признаков — OHLC-свечи; глубина лестницы есть в списке фич, но частота — минута, не событие стакана.

Литература

  1. Angelone, A., Letteri, I., and Vittorini, P. (2023). First evaluation of an adaptive tool supporting formative assessment in data science courses. In MIS4TEL 2023, LNNS 764, 144–151. Springer.
  2. Apergis, N., Koutmos, D., and Payne, J. E. (2021). Convergence in cryptocurrency prices? the role of market microstructure. Finance Research Letters, 40:101685.
  3. Breunig, M. M., Kriegel, H.-P., Ng, R. T., and Sander, J. (2000). LOF: identifying density-based local outliers. ACM SIGMOD Record, 29(2):93–104.
  4. Chohan, U. W. (2017). Bitcoins and Bank Runs: Analysis of Market Imperfections and Investor Hysterics. SSRN Electronic Journal.
  5. Cortez, K., Rodríguez-García, M. d. P., and Mongrut, S. (2021). Exchange market liquidity prediction with the k-nearest neighbor approach: Crypto vs. fiat currencies. Mathematics, 9(1).
  6. Coën, A. and de La Bruslerie, H. (2019). The informational dimensions of the Amihud (2002) illiquidity measure: Evidence from the M&A market. Finance Research Letters, 29:23–29.
  7. Dimpfl, T. and Peter, F. J. (2021). Nothing but noise? Price discovery across cryptocurrency exchanges. Journal of Financial Markets, 54:100584.
  8. Dyoub, A., Costantini, S., and Letteri, I. (2022). Care robots learning rules of ethical behavior under the supervision of an ethical teacher. HYDRA/RCRA 2022, CEUR 3281, 1–8.
  9. Dyoub, A., Costantini, S., Letteri, I., and Lisi, F. A. (2021). A logic-based multi-agent system for ethical monitoring and evaluation of dialogues. ICLP 2021, EPTCS 345, 182–188.
  10. Dyoub, A., Costantini, S., Lisi, F. A., and Letteri, I. (2020). Logic-based machine learning for transparent ethical agents. CILC 2020, CEUR 2710, 169–183.
  11. Fratrič, P., Sileno, G., Klous, S., and Van Engers, T. (2022). Manipulation of the Bitcoin market: an agent-based study. Financial Innovation, 8(1):60.
  12. Gasperis, G. D., Costantini, S., Rafanelli, A., Migliarini, P., Letteri, I., and Dyoub, A. (2023). Extension of constraint-procedural logic-generated environments for deep Q-learning agent training and benchmarking. J. Log. Comput., 33(8):1712–1733.
  13. Hubert, M. and Debruyne, M. (2010). Minimum covariance determinant. WIREs Computational Statistics, 2(1):36–43.
  14. Kercheval, A. N. and Zhang, Y. (2015). Modelling high-frequency limit order book dynamics with support vector machines. Quantitative Finance, 15(8):1315–1329.
  15. Koutmos, D. (2018). Return and volatility spillovers among cryptocurrencies. Economics Letters, 173:122–127.
  16. Letteri, I. (2023a). AITA: A new framework for trading forward testing with an artificial intelligence engine. Ital-IA 2023, CEUR 3486, 506–511.
  17. Letteri, I. (2023b). VolTS: A volatility-based trading system to forecast stock markets trend using statistics and machine learning.
  18. Letteri, I. (2024). Stock market forecasting using machine learning models through volatility-driven trading strategies. FEMIB 2024, 96–103. SCITEPRESS.
  19. Letteri, I., Cecco, A. D., and Penna, G. D. (2020). Dataset optimization strategies for malware-traffic detection. CoRR, abs/2009.11347.
  20. Letteri, I., Cecco, A. D., and Penna, G. D. (2021). New optimization approaches in malware traffic analysis. LOD 2021, LNCS 13163, 57–68. Springer.
  21. Letteri, I., Della Penna, G., De Gasperis, G., and Dyoub, A. (2023). Trading Strategy Validation Using Forwardtesting with Deep Neural Networks. FEMIB 2023, 15–25. SCITEPRESS.
  22. Letteri, I., Penna, G. D., and Caianiello, P. (2019a). Feature selection strategies for HTTP botnet traffic detection. IEEE EuroS&P Workshops 2019, 202–210.
  23. Letteri, I., Penna, G. D., and Gasperis, G. D. (2019b). Security in the internet of things: botnet detection in software-defined networks by deep learning techniques. Int. J. High Perform. Comput. Netw., 15(3/4):170–182.
  24. Letteri, I., Penna, G. D., Gasperis, G. D., and Dyoub, A. (2022a). DNN-ForwardTesting: A new trading strategy validation using statistical timeseries analysis and deep neural networks.
  25. Letteri, I., Penna, G. D., Gasperis, G. D., and Dyoub, A. (2022b). A stock trading system for a medium volatile asset using multi layer perceptron. CoRR, abs/2201.12286.
  26. Letteri, I. and Vittorini, P. (2024). Exploring the impact of LLM-generated feedback. MIS4TEL 2024, LNNS 1171, 11–20. Springer.
  27. Nguyen, M.-N. and Vien, N. A. (2019). Scalable and interpretable one-class SVMs with deep learning and random Fourier features. ECML PKDD, 157–172. Springer.
  28. Tadi, M. and Kortchemski, I. (2021). Evaluation of dynamic cointegration-based pairs trading strategy in the cryptocurrency market. Studies in Economics and Finance, 38(5):1054–1075.
  29. Vince, R. (1992). The mathematics of money management: risk analysis techniques for traders. Wiley, New York.
  30. Wang, X. and Wellman, M. P. (2017). Spoofing the limit order book: an agent-based model. AAMAS 2017, 651–659. ACM.

Перевод: полный основной текст. Таблицы 1–3 и рис. 1–6 сохранены. · arXiv:2507.14960 · лицензия CC BY-NC-ND 4.0