

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Uma equipe de planejamento da SEPLAG está preparando um conjunto de dados para análise em Python, usando Pandas. O DataFrame df contém informações sobre projetos estratégicos, incluindo colunas como projeto, responsavel, orcamento, prazo_dias e cpf_responsavel. Durante a análise exploratória, foram identificados valores ausentes em prazo_dias, duplicatas em projeto e valores extremos em orcamento.Além disso, os dados serão compartilhados com parceiros externos. Em condições ideais, uma prática que se adequa a este cenário é
criar os gráficos finais primeiro e realizar a análise exploratória em seguida, pois isso evita alterações nos dados que possam comprometer a visualização.
remover valores ausentes em prazo_dias, usando df.dropna (subset='prazo_dias'), o que garante que todos os registros com dados incompletos sejam eliminados.
aplicar um tipo de anonimização na coluna cpf_responsavel, utilizando um salt, com df['cpf_responsavel'] = df ['cpf_responsavel'].apply(lambda x: hash (salt + str(x)), o que converte os CPFs em identificadores não reversíveis e menos suscetíveis à reidentificação.
promover a detecção de outliers em orçamento, usando df['orcamento']= df['orcamento'].drop_outliers(),pois esses valores indicam desvios estatísticos significativos em relação à média ou à massa total dos dados.
remover duplicatas em projeto, usando o comando df.drop_duplicates (subset=None, keep=None, inplace=False), que verifica a coluna projeto e remove todos os registros duplicados diretamente sobre o Dataframe df.