Коли американський банк вперше запустив кредитну модель, навчену за допомогою градієнтного бустингу, звіт про валідацію був у чотири рази довшим, ніж документація моделі. Це співвідношення досі зберігається. У 2026 році побудова кількісної моделі для фінансового ринку США становить приблизно 20 відсотків коду, 30 відсотків роботи з даними та 50 відсотків валідації, документації та перевірки. Цей посібник описує фактичні механізми.
США є найщільнішим ринком кількісних фінансів у світі за капіталом та кількістю працівників. Дані нагляду Федеральної резервної системи показують приблизно 4000 банків, регульованих на федеральному рівні, а найбільші 30 мають десятки тисяч окремих моделей у своїх інвентаризаціях. Методи, що лежать в основі, формалізовані в бюлетені OCC SR 11-7 з управління ризиками моделей, який став стандартом для всієї банківської індустрії США.
Наскрізний конвеєр
Робочий кількісний конвеєр має шість етапів: збір даних, інженерія ознак, навчання моделі, бектестування, валідація та моніторинг у виробництві. Збір даних отримує історичні та поточні дані з ринкових каналів, транзакційних систем, кредитних бюро та внутрішніх сховищ. Інженерія ознак створює вхідні дані, які бачитиме модель, включаючи лаги, співвідношення та індикаторні змінні. Навчання моделі підганяє модель на обраному періоді навчання. Бектестування перевіряє модель на даних поза вибіркою для оцінки узагальнення. Валідація виконується окремою командою і підтверджує, що модель відповідає політиці. Моніторинг у виробництві відстежує поведінку моделі після розгортання.
Кожен етап має власний стек програмного забезпечення. Дані зберігаються в Snowflake, Databricks або Amazon Redshift у більшості установ США. Інженерія ознак виконується в Python pandas або PySpark. Навчання моделі використовує scikit-learn, XGBoost, LightGBM або PyTorch. Бектестування виконується в блокнотах Python або R. Звіти про валідацію зберігаються у PDF та HTML у репозиторіях документів. Моніторинг у виробництві працює на дашбордах, створених у Splunk, Datadog або внутрішніх інструментах.
Три лінії захисту навколо банківських моделей США
Структура управління банківськими моделями США слідує підходу трьох ліній захисту. Перша лінія — це бізнес-підрозділ, який володіє моделлю та використовує її результати. Друга лінія — функція управління ризиками моделей, яка незалежно валідує модель, оскаржує припущення та дає дозвіл на розгортання у виробництві. Третя лінія — внутрішній аудит, який перевіряє діяльність першої та другої ліній. Ця структура є обов'язковою для будь-якого банку США з активами понад 10 мільярдів доларів і широко прийнята нижче цього порогу.
SR 11-7 є контрольним документом. Він визначає ризик моделі, вимагає інвентаризації моделей, зобов'язує проводити валідацію, яка включає перевірку концептуальної обґрунтованості та постійний моніторинг, і призначає чітку відповідальність. Екзамени нагляду Федеральної резервної системи посилаються на SR 11-7 при виявленні недоліків моделей. Банки, які не відповідають вимогам SR 11-7, стикаються з питаннями, що потребують уваги, відшкодуванням та в крайніх випадках примусовими заходами.
Інструменти, які насправді використовують американські фінтех-компанії та банки
Інструментарій більш консолідований, ніж припускають сторонні. Python є домінуючою мовою для нової кількісної роботи в установах США, при цьому R зберігає частку в актуарних та статистичних звітних ролях. Бібліотеки, які працюють у виробництві, включають NumPy та pandas для обробки даних, statsmodels для економетрики, scikit-learn для загального машинного навчання, XGBoost та LightGBM для градієнтного бустингу, PyTorch та TensorFlow для глибокого навчання, а також CVXPY або Gurobi для оптимізації. Стек розгортання зазвичай працює на Kubernetes, з MLflow або Weights and Biases для відстеження експериментів та SageMaker або Vertex AI для розміщення виробничих моделей.
| Етап конвеєра | Типовий інструмент США | Власник |
|---|---|---|
| Збір даних | Snowflake, Databricks, Kafka | Інженерія даних |
| Інженерія ознак | pandas, PySpark, Feast | Команда моделювання |
| Навчання моделі | scikit-learn, XGBoost, PyTorch | Команда моделювання |
| Бектест та валідація | Jupyter, MLflow, внутрішні | Ризик моделі (друга лінія) |
| Розгортання у виробництві | SageMaker, Vertex AI, внутрішні | ML інженерія |
| Моніторинг | Datadog, Splunk, Arize | ML ops + перша лінія |
Джерела: розкриття постачальників, рамкова структура OCC SR 11-7, розкриття технологій банків США 2024-2026.
Дисципліна даних, що стоїть за придатною моделлю
Погані дані руйнують кількісну роботу швидше, ніж погана математика. Дисципліна банків США щодо даних моделювання посилилася. Моделі, навчені на даних у реальному часі, тестування витоків, періоди утримання та баланс класів тепер є базовими очікуваннями. Бектестування, яке використовує неправильний горизонт або не враховує зміни в регулюванні, продукті чи розподілі, не пройде перевірку валідації. Більшість установ США тепер вимагають від власників моделей документувати походження даних від початку до кінця, перш ніж модель може бути просунута.
Як банки та фінтех-компанії впроваджують модель після запуску
Моніторинг у виробництві — це те, де більшість кількісних програм тихо провалюються. Модель, яка добре працювала в бектесті, може деградувати у виробництві з багатьох причин, включаючи зсув популяції, дрейф ознак та зміни в даних вищого рівня. Дисципліна в добре керованих установах США полягає у відстеженні розподілів вхідних даних, розподілів вихідних даних та бізнес-результатів нижчого рівня щоденно або щотижня. Якщо будь-який з них відхиляється за поріг, модель перенавчається або тимчасово замінюється резервним варіантом чемпіон-претендент.
Установи, які серйозно ставляться до цього, виглядають однаково зсередини: невелика група кількісних аналітиків у парі з рецензентами ризику моделей, задокументований інвентар, календар подій валідації та дашборд, який показує стан кожної виробничої моделі. Математика під цим іноді проста, іноді складна. Управління навколо цього завжди є обов'язковим.

