Gdy pierwszy raz amerykański bank wdrożył model kredytowy trenowany za pomocą gradient boosting, raport walidacyjny był cztery razy dłuższy niż dokumentacja modelu. Ten stosunek wciąż obowiązuje. W 2026 roku budowa modelu ilościowego dla amerykańskiego rynku finansowego to w przybliżeniu 20 procent kodu, 30 procent pracy z danymi i 50 procent walidacji, dokumentacji i przeglądu. Ten przewodnik przeprowadzi przez rzeczywiste mechanizmy.
USA to najgęstszy rynek finansów ilościowych na świecie pod względem kapitału i zatrudnienia. Dane nadzoru Rezerwy Federalnej pokazują około 4000 banków regulowanych na szczeblu federalnym, a największe 30 posiada dziesiątki tysięcy odrębnych modeli w swoich rejestrach. Metody te są sformalizowane w biuletynie OCC SR 11-7 dotyczącym zarządzania ryzykiem modeli, który został ustandaryzowany przez cały amerykański sektor bankowy.
Kompletny pipeline
Działający pipeline ilościowy składa się z sześciu etapów: pozyskiwanie danych, inżynieria cech, trenowanie modelu, testowanie wsteczne, walidacja i monitorowanie produkcji. Pozyskiwanie danych pobiera dane historyczne i bieżące z kanałów rynkowych, systemów transakcyjnych, biur kredytowych i wewnętrznych magazynów. Inżynieria cech buduje dane wejściowe, które model będzie widział, w tym opóźnienia, wskaźniki i zmienne wskaźnikowe. Trenowanie modelu dopasowuje model do wybranego okresu treningowego. Testowanie wsteczne uruchamia model na danych poza próbą, aby oszacować generalizację. Walidacja jest przeprowadzana przez oddzielny zespół i potwierdza, że model spełnia politykę. Monitorowanie produkcji śledzi zachowanie modelu po wdrożeniu.
Każdy etap ma własny stos oprogramowania. Dane w większości amerykańskich instytucji znajdują się w Snowflake, Databricks lub Amazon Redshift. Inżynieria cech działa w Python pandas lub PySpark. Trenowanie modelu używa scikit-learn, XGBoost, LightGBM lub PyTorch. Testowanie wsteczne działa w notebookach Python lub R. Raporty walidacyjne są przechowywane w PDF i HTML w repozytoriach dokumentów. Monitorowanie produkcji działa na pulpitach nawigacyjnych zbudowanych w Splunk, Datadog lub wewnętrznych narzędziach.
Trzy linie obrony wokół modeli banków amerykańskich
Struktura zarządzania modelami banków amerykańskich opiera się na podejściu trzech linii obrony. Pierwsza linia to jednostka biznesowa, która jest właścicielem modelu i korzysta z jego wyników. Druga linia to funkcja zarządzania ryzykiem modeli, która niezależnie waliduje model, kwestionuje założenia i zatwierdza wdrożenie produkcyjne. Trzecia linia to audyt wewnętrzny, który przegląda działania pierwszej i drugiej linii. Struktura ta jest wymagana dla każdego amerykańskiego banku o aktywach powyżej 10 miliardów dolarów i jest powszechnie przyjęta poniżej tego progu.
SR 11-7 jest dokumentem nadrzędnym. Definiuje ryzyko modelu, wymaga rejestrów modeli, nakazuje walidację obejmującą przegląd poprawności koncepcyjnej i bieżące monitorowanie oraz przypisuje wyraźną odpowiedzialność. Egzaminy nadzorcze Rezerwy Federalnej odwołują się do SR 11-7 przy wykrywaniu niedociągnięć modeli. Banki, które nie spełniają oczekiwań SR 11-7, stają w obliczu spraw wymagających uwagi, restytucji, a w skrajnych przypadkach działań egzekucyjnych.
Narzędzia, których faktycznie używają amerykańskie fintechy i banki
Zestaw narzędzi jest bardziej skonsolidowany, niż zakładają osoby z zewnątrz. Python jest dominującym językiem do nowych prac ilościowych w amerykańskich instytucjach, a R utrzymuje udział w rolach aktuarialnych i sprawozdawczości statystycznej. Biblioteki używane w produkcji to NumPy i pandas do obsługi danych, statsmodels do ekonometrii, scikit-learn do ogólnego uczenia maszynowego, XGBoost i LightGBM do gradient boosting, PyTorch i TensorFlow do głębokiego uczenia oraz CVXPY lub Gurobi do optymalizacji. Stos wdrożeniowy zazwyczaj działa na Kubernetes, z MLflow lub Weights and Biases do śledzenia eksperymentów oraz SageMaker lub Vertex AI do hostowania modeli produkcyjnych.
| Etap pipeline'u | Typowe narzędzie amerykańskie | Właściciel |
|---|---|---|
| Pozyskiwanie danych | Snowflake, Databricks, Kafka | Inżynieria danych |
| Inżynieria cech | pandas, PySpark, Feast | Zespół modelujący |
| Trenowanie modelu | scikit-learn, XGBoost, PyTorch | Zespół modelujący |
| Testowanie wsteczne i walidacja | Jupyter, MLflow, wewnętrzne | Ryzyko modelu (druga linia) |
| Wdrożenie produkcyjne | SageMaker, Vertex AI, wewnętrzne | Inżynieria ML |
| Monitorowanie | Datadog, Splunk, Arize | Operacje ML + pierwsza linia |
Źródła: ujawnienia dostawców, ramy OCC SR 11-7, ujawnienia technologiczne banków amerykańskich 2024-2026.
Dyscyplina danych za użytecznym modelem
Złe dane niszczą pracę ilościową szybciej niż zła matematyka. Dyscyplina amerykańskich banków w zakresie danych modelowych zaostrzyła się. Modele trenowane na danych punktowych, testowanie wycieków, okresy wstrzymania i równowaga klas są teraz podstawowym oczekiwaniem. Testowanie wsteczne, które używa złego horyzontu lub nie uwzględnia zmian w regulacjach, produkcie lub dystrybucji, nie przetrwa przeglądu walidacyjnego. Większość amerykańskich instytucji wymaga teraz, aby właściciele modeli dokumentowali pochodzenie danych od początku do końca, zanim model zostanie promowany.
Jak banki i fintechy operacjonalizują model po uruchomieniu
Monitorowanie produkcji to miejsce, gdzie większość programów ilościowych cicho zawodzi. Model, który dobrze radził sobie w testach wstecznych, może ulec degradacji w produkcji z wielu powodów, w tym zmiany populacji, dryfu cech i zmian w danych źródłowych. Dyscyplina w dobrze zarządzanych amerykańskich instytucjach polega na śledzeniu rozkładów wejściowych, rozkładów wyjściowych i wyników biznesowych w dalszej części w cyklu dziennym lub tygodniowym. Jeśli którykolwiek z nich przekroczy próg, model jest ponownie trenowany lub tymczasowo zastępowany przez rozwiązanie rezerwowe champion-challenger.
Instytucje, które traktują to poważnie, wyglądają podobnie od wewnątrz: mała grupa analityków ilościowych w parze z recenzentami ryzyka modeli, udokumentowany rejestr, kalendarz zdarzeń walidacyjnych oraz pulpit nawigacyjny pokazujący stan każdego modelu produkcyjnego. Matematyka pod spodem jest czasami prosta, czasami złożona. Zarządzanie wokół niej jest zawsze niepodlegające negocjacjom.

