Imagem de fundo

Um cientista de dados treinou três modelos para prever evasão escolar usando dados de 1...

Um cientista de dados treinou três modelos para prever evasão escolar usando dados de 12.000 alunos de 2019-2023: Random Forest, XGBoost e Regressão Logística. Para avaliar os modelos, dividiu o dataset em 70% treino e 30% teste, treinou cada modelo no conjunto de treino e reportou as seguintes acurácias no teste: RF=89%, XGBoost=91%, Logística=82%.


Com base nesses resultados, foi recomendado o XGBoost para produção.


A avaliação dessa metodologia de validação é:


A

correta, pois a divisão 70/30 é padrão da indústria e a acurácia no teste é métrica adequada para classificação binária;


B

incorreta, porque single train-test split pode gerar resultado otimista por sorte na divisão; deveria usar k-fold cross-validation para estimar performance média e variância;


C

correta, desde que a divisão preserve a proporção de classes (stratified split) e que o conjunto de teste não tenha vazamento de dados do treino;


D

incorreta, pois séries temporais (2019-2023) exigem validação temporal forward-chaining, e não split aleatório que viola ordenação temporal;


E

correta para seleção preliminar, mas produção exige validação em dados totalmente novos (holdout set separado) não vistos durante o desenvolvimento.