

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Um cientista de dados treinou três modelos para prever evasão escolar usando dados de 12.000 alunos de 2019-2023: Random Forest, XGBoost e Regressão Logística. Para avaliar os modelos, dividiu o dataset em 70% treino e 30% teste, treinou cada modelo no conjunto de treino e reportou as seguintes acurácias no teste: RF=89%, XGBoost=91%, Logística=82%.
Com base nesses resultados, foi recomendado o XGBoost para produção.
A avaliação dessa metodologia de validação é:
correta, pois a divisão 70/30 é padrão da indústria e a acurácia no teste é métrica adequada para classificação binária;
incorreta, porque single train-test split pode gerar resultado otimista por sorte na divisão; deveria usar k-fold cross-validation para estimar performance média e variância;
correta, desde que a divisão preserve a proporção de classes (stratified split) e que o conjunto de teste não tenha vazamento de dados do treino;
incorreta, pois séries temporais (2019-2023) exigem validação temporal forward-chaining, e não split aleatório que viola ordenação temporal;
correta para seleção preliminar, mas produção exige validação em dados totalmente novos (holdout set separado) não vistos durante o desenvolvimento.