Poço de Urðr · das normas e do destino

Metodologia

O porquê de cada método da esteira: fórmula, como é computado no código e, sobretudo, as armadilhas. Escrito para quem precisa auditar e defender escolhas metodológicas perante validação independente e governança.

O contrato de amostras

Toda a esteira gira em torno de uma convenção. A base de desenvolvimento (DES) é a fotografia sobre a qual todos os cortes, cutoffs e referências de estabilidade são aprendidos e congelados. A base out-of-time (OOT) é uma janela temporal posterior, usada para testar generalização. Safras de produção são monitoradas continuamente contra a referência DES, nunca contra si mesmas.

A convenção de alvo é fixa: y = 1 denota o evento de interesse (o "mau", inadimplência ou default) e y = 0 o "bom". Métricas de regressão aplicam-se a alvos contínuos como LGD e EAD.

Amostras SIMUL e BACKTEST são scoring-only: recebem predição e grupo homogêneo, mas não entram na aprendizagem de nenhum corte.

1 · Métricas de discriminação, erro e shifts

O fio condutor é simples: separar quem é bom de quem é mau (discriminação), errar pouco na magnitude prevista (erro) e garantir que o desempenho do desenvolvimento se sustente fora da janela de treino (shifts).

Discriminação

métricao que medearmadilha principal
KSMáxima distância entre as CDFs do score de bons e maus.Mede a separação em um único ponto da curva. KS > 0,75 quase sempre é leakage, não talento.
AUC / GiniProbabilidade de um mau receber score maior que um bom, na curva inteira.Insensível a calibração: um modelo pode ordenar bem e prever níveis errados.
BrierErro quadrático médio da probabilidade prevista.Mistura discriminação e calibração num número só, então decomponha antes de concluir.
Log lossEntropia cruzada binária.Penaliza confiança errada de forma ilimitada; sensível a poucos casos extremos.
Cutoff KS-ótimoPonto de corte no score onde o KS é atingido.É ótimo estatisticamente, não economicamente. Aprenda em DES e congele.

Faixas orientativas de KS

faixaleitura
< 0,20discriminação fraca
0,20 a 0,40aceitável a bom
> 0,40forte
> 0,75suspeito de leakage ou vazamento de tempo

Erro e shifts

Para alvos contínuos a esteira reporta RMSE, MAE, MAPE robusto, sMAPE, MedAE, e viés. Em cima de tudo isso, os shifts DES → OOT de cada métrica, em valor absoluto e relativo: é o shift, e não o nível, que revela se o modelo generaliza.

2 · Grupos homogêneos e binning monotônico

Em crédito, um escore contínuo raramente é o produto final, porque a decisão opera sobre faixas. A exigência central é a monotonicidade: se o rating A é melhor que o B, a taxa de evento observada em A tem de ser menor. Faixa não monotônica é rejeitada em validação independente, por melhor que seja o AUC.

Quatro metodologias, mesma interface

metodologiacomo funcionaquando usar
decisDez faixas de igual população, aprendidas em DES.Referência simples e auditável. O ponto de partida.
quantilQuantis finos + fusão monotônica por inversão (Mann-Whitney).Quando os decis quebram a monotonicidade nas pontas.
arvoreDecisionTree sobre o score, cortes por ganho.Quando o risco muda em degraus e não suavemente.
optbinOptBinning com restrição de monotonicidade embutida.Quando você quer o ótimo sob restrição, sem ajuste manual.

WoE e IV

O Weight of Evidence converte cada bin no logaritmo da razão entre a proporção de bons e a de maus; o Information Value soma essa evidência ponderada ao longo dos bins, na escala de Siddiqi. A esteira também aplica IV contínuo em problemas de regressão.

O relatório por grupo (group_report) fecha o capítulo com média prevista versus observada, representatividade e o teste de monotonicidade (is_monotonic), o conjunto mínimo que uma área de validação vai pedir.

3 · Estabilidade e monitoramento no tempo

O PSI (Population Stability Index) compara a distribuição de uma safra contra a referência congelada em DES. O CSI decompõe esse PSI por bin, mostrando onde a população se moveu.

PSIleitura convencional
< 0,10estável
0,10 a 0,25deslocamento moderado, investigar
> 0,25deslocamento severo, revisar o modelo

Duas distinções importam. Primeiro, PSI de escore não é PSI de feature: o escore pode ficar estável enquanto duas variáveis se movem em direções opostas e se cancelam. Segundo, missing por safra merece série própria, porque uma quebra de ingestão aparece ali antes de aparecer em qualquer métrica de performance.

4 · Interpretabilidade e EDA de features

O SHAP atribui a cada variável a sua contribuição marginal média para a predição, sobre todas as ordens possíveis de entrada, os valores de Shapley da teoria dos jogos cooperativos. A esteira registra a importância global por |SHAP| médio e o gráfico beeswarm, que mostra também a direção do efeito.

O que a EDA calcula por feature

  • Missing global e por safra, com detecção de quebras.
  • Percentis e drift de distribuição ao longo do tempo.
  • WoE/IV univariado e relação com o alvo.
  • Importância univariada vs. multivariada: a distância entre as duas denuncia redundância.
  • Leakage: sinal alto demais, cedo demais.
  • Estabilidade (PSI/CSI por feature) e monotonicidade.
  • Correlação, VIF e redundância entre candidatas.

O veredito automático

Tudo isso é consolidado no feature_profile, uma linha por feature, com um veredito de manter, revisar ou descartar. O veredito é uma recomendação com as flags que o originaram, não um decreto: a decisão final continua sendo do modelador, que precisa justificá-la.

Como ler o documento completo

Esta página é um mapa. O documento em docs/metodologia.md traz, para cada método, quatro blocos fixos: o que mede, a fórmula em LaTeX, como o yggdrasil computa (com a função real e o arquivo onde ela vive) e as armadilhas. São cinco capítulos e cerca de quarenta subseções, mais as referências.