

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Um estatístico está construindo um modelo preditivo com um número muito grande de variáveis preditoras (p > n), muitas das quais são provavelmente irrelevantes e correlacionadas entre si. O objetivo é criar um modelo parcimonioso, que realize a seleção de variáveis e a regularização simultaneamente para evitar o superajuste (overfitting). Qual das seguintes técnicas de modelagem é a mais adequada para este propósito específico?
Análise de Variância (ANOVA), pois ela permite testar a significância de cada variável individualmente, selecionando apenas aquelas com p-valor abaixo de 0,05 para o modelo final.
Análise de Componentes Principais (ACP) seguida de regressão, pois a ACP seleciona as variáveis originais mais importantes, descartando as demais.
Seleção "stepwise" (passo a passo), pois este método garante a descoberta do melhor subconjunto de preditores sem o risco de superajuste, sendo computacionalmente eficiente em cenários com mais variáveis que observações (p > n).
Regressão LASSO (Least Absolute Shrinkage and Selection Operator), pois sua penalidade L1 (soma dos valores absolutos dos coeficientes) tem a propriedade de encolher os coeficientes de variáveis irrelevantes exatamente para zero, efetivamente removendo-as do modelo e realizando a seleção de variáveis.
Regressão Ridge, pois sua penalidade L2 (soma dos quadrados dos coeficientes) é mais eficaz na seleção de variáveis, zerando os coeficientes dos preditores menos importantes.