Imagem de fundo

Uma equipe de ciência de dados está desenvolvendo um modelo de classificação de inadimp...

Uma equipe de ciência de dados está desenvolvendo um modelo de classificação de inadimplência em um conjunto de dados tabular com informações numéricas e categóricas de clientes (renda, idade, histórico de crédito, limite etc.).

O conjunto está fortemente desbalanceado: apenas 3% dos registros pertencem à classe denominada inadimplente. O time deseja aumentar a quantidade de exemplos da classe minoritária sem simplesmente duplicar registros existentes, gerando novas amostras sintéticas entre os pontos reais da classe positiva, para reduzir o risco de overfitting associado ao oversampling ingênuo.


A técnica de balanceamento de classes adequada para esse cenário é:


A

SMOTE;


B

oversampling aleatório da classe minoritária;


C

undersampling aleatório da classe majoritária;


D

data augmentation baseada em ruído gaussiano na classe minoritária;


E

ajuste de pesos de classe (class weights) no algoritmo de aprendizado.