Poço de Urðr · das normas e do destino
Metodologia
O porquê de cada método da esteira: fórmula, como é computado no código e, sobretudo, as armadilhas. Escrito para quem precisa auditar e defender escolhas metodológicas perante validação independente e governança.
O contrato de amostras
Toda a esteira gira em torno de uma convenção. A base de desenvolvimento (DES) é a fotografia sobre a qual todos os cortes, cutoffs e referências de estabilidade são aprendidos e congelados. A base out-of-time (OOT) é uma janela temporal posterior, usada para testar generalização. Safras de produção são monitoradas continuamente contra a referência DES, nunca contra si mesmas.
A convenção de alvo é fixa: y = 1 denota o evento de interesse (o "mau",
inadimplência ou default) e y = 0 o "bom". Métricas de regressão aplicam-se
a alvos contínuos como LGD e EAD.
AmostrasSIMULeBACKTESTsão scoring-only: recebem predição e grupo homogêneo, mas não entram na aprendizagem de nenhum corte.
1 · Métricas de discriminação, erro e shifts
O fio condutor é simples: separar quem é bom de quem é mau (discriminação), errar pouco na magnitude prevista (erro) e garantir que o desempenho do desenvolvimento se sustente fora da janela de treino (shifts).
Discriminação
| métrica | o que mede | armadilha principal |
|---|---|---|
KS | Máxima distância entre as CDFs do score de bons e maus. | Mede a separação em um único ponto da curva. KS > 0,75 quase sempre é leakage, não talento. |
AUC / Gini | Probabilidade de um mau receber score maior que um bom, na curva inteira. | Insensível a calibração: um modelo pode ordenar bem e prever níveis errados. |
Brier | Erro quadrático médio da probabilidade prevista. | Mistura discriminação e calibração num número só, então decomponha antes de concluir. |
Log loss | Entropia cruzada binária. | Penaliza confiança errada de forma ilimitada; sensível a poucos casos extremos. |
Cutoff KS-ótimo | Ponto de corte no score onde o KS é atingido. | É ótimo estatisticamente, não economicamente. Aprenda em DES e congele. |
Faixas orientativas de KS
| faixa | leitura |
|---|---|
< 0,20 | discriminação fraca |
0,20 a 0,40 | aceitável a bom |
> 0,40 | forte |
> 0,75 | suspeito de leakage ou vazamento de tempo |
Erro e shifts
Para alvos contínuos a esteira reporta RMSE, MAE, MAPE
robusto, sMAPE, MedAE, R² e viés. Em cima de tudo isso,
os shifts DES → OOT de cada métrica, em valor absoluto e relativo: é o shift,
e não o nível, que revela se o modelo generaliza.
2 · Grupos homogêneos e binning monotônico
Em crédito, um escore contínuo raramente é o produto final, porque a decisão opera sobre faixas. A exigência central é a monotonicidade: se o rating A é melhor que o B, a taxa de evento observada em A tem de ser menor. Faixa não monotônica é rejeitada em validação independente, por melhor que seja o AUC.
Quatro metodologias, mesma interface
| metodologia | como funciona | quando usar |
|---|---|---|
decis | Dez faixas de igual população, aprendidas em DES. | Referência simples e auditável. O ponto de partida. |
quantil | Quantis finos + fusão monotônica por inversão (Mann-Whitney). | Quando os decis quebram a monotonicidade nas pontas. |
arvore | DecisionTree sobre o score, cortes por ganho. | Quando o risco muda em degraus e não suavemente. |
optbin | OptBinning com restrição de monotonicidade embutida. | Quando você quer o ótimo sob restrição, sem ajuste manual. |
WoE e IV
O Weight of Evidence converte cada bin no logaritmo da razão entre a proporção de bons e a de maus; o Information Value soma essa evidência ponderada ao longo dos bins, na escala de Siddiqi. A esteira também aplica IV contínuo em problemas de regressão.
O relatório por grupo (group_report) fecha o capítulo com média prevista versus
observada, representatividade e o teste de monotonicidade (is_monotonic), o
conjunto mínimo que uma área de validação vai pedir.
3 · Estabilidade e monitoramento no tempo
O PSI (Population Stability Index) compara a distribuição de uma safra contra a referência congelada em DES. O CSI decompõe esse PSI por bin, mostrando onde a população se moveu.
| PSI | leitura convencional |
|---|---|
< 0,10 | estável |
0,10 a 0,25 | deslocamento moderado, investigar |
> 0,25 | deslocamento severo, revisar o modelo |
Duas distinções importam. Primeiro, PSI de escore não é PSI de feature: o escore pode ficar estável enquanto duas variáveis se movem em direções opostas e se cancelam. Segundo, missing por safra merece série própria, porque uma quebra de ingestão aparece ali antes de aparecer em qualquer métrica de performance.
4 · Interpretabilidade e EDA de features
O SHAP atribui a cada variável a sua contribuição marginal média para a predição, sobre todas
as ordens possíveis de entrada, os valores de Shapley da teoria dos jogos cooperativos. A
esteira registra a importância global por |SHAP| médio e o gráfico
beeswarm, que mostra também a direção do efeito.
O que a EDA calcula por feature
- Missing global e por safra, com detecção de quebras.
- Percentis e drift de distribuição ao longo do tempo.
- WoE/IV univariado e relação com o alvo.
- Importância univariada vs. multivariada: a distância entre as duas denuncia redundância.
- Leakage: sinal alto demais, cedo demais.
- Estabilidade (PSI/CSI por feature) e monotonicidade.
- Correlação, VIF e redundância entre candidatas.
O veredito automático
Tudo isso é consolidado no feature_profile, uma linha por feature, com um
veredito de manter, revisar ou descartar. O veredito é uma
recomendação com as flags que o originaram, não um decreto: a decisão final continua
sendo do modelador, que precisa justificá-la.
Como ler o documento completo
Esta página é um mapa. O documento em docs/metodologia.md traz, para cada método,
quatro blocos fixos: o que mede, a fórmula em LaTeX, como o yggdrasil computa
(com a função real e o arquivo onde ela vive) e as armadilhas. São cinco capítulos e
cerca de quarenta subseções, mais as referências.