Imagem de fundo

Uma equipe de planejamento da SEPLAG está preparando um...

Uma equipe de planejamento da SEPLAG está preparando um conjunto de dados para análise em Python, usando Pandas. O DataFrame df contém informações sobre projetos estratégicos, incluindo colunas como projeto, responsavel, orcamento, prazo_dias e cpf_responsavel. Durante a análise exploratória, foram identificados valores ausentes em prazo_dias, duplicatas em projeto e valores extremos em orcamento.Além disso, os dados serão compartilhados com parceiros externos. Em condições ideais, uma prática que se adequa a este cenário é


A

criar os gráficos finais primeiro e realizar a análise exploratória em seguida, pois isso evita alterações nos dados que possam comprometer a visualização.


B

remover valores ausentes em prazo_dias, usando df.dropna (subset='prazo_dias'), o que garante que todos os registros com dados incompletos sejam eliminados.


C

aplicar um tipo de anonimização na coluna cpf_responsavel, utilizando um salt, com df['cpf_responsavel'] = df ['cpf_responsavel'].apply(lambda x: hash (salt + str(x)), o que converte os CPFs em identificadores não reversíveis e menos suscetíveis à reidentificação.


D

promover a detecção de outliers em orçamento, usando df['orcamento']= df['orcamento'].drop_outliers(),pois esses valores indicam desvios estatísticos significativos em relação à média ou à massa total dos dados.


E

remover duplicatas em projeto, usando o comando df.drop_duplicates (subset=None, keep=None, inplace=False), que verifica a coluna projeto e remove todos os registros duplicados diretamente sobre o Dataframe df.