Imagem de fundo

Uma equipe de planejamento da SEPLAG está preparando um conjunto de dados para análise ...

Uma equipe de planejamento da SEPLAG está preparando um conjunto de dados para análise em Python, usando Pandas. O DataFrame df contém informações sobre projetos estratégicos, incluindo colunas como projeto, responsavel, orcamento, prazo_dias e cpf_responsavel. Durante a análise exploratória, foram identificados valores ausentes em prazo_dias, duplicatas em projeto e valores extremos em orcamento.Além disso, os dados serão compartilhados com parceiros externos. Em condições ideais, uma prática que se adequa a este cenário é


A

criar os gráficos finais primeiro e realizar a análise exploratória em seguida, pois isso evita alterações nos dados que possam comprometer a visualização.


B

remover valores ausentes em prazo_dias, usando df.dropna (subset='prazo_dias'), o que garante que todos os registros com dados incompletos sejam eliminados.


C

aplicar um tipo de anonimização na coluna cpf_responsavel, utilizando um salt, com df['cpf_responsavel'] = df ['cpf_responsavel'].apply(lambda x: hash (salt + str(x)), o que converte os CPFs em identificadores não reversíveis e menos suscetíveis à reidentificação.


D

promover a detecção de outliers em orçamento, usando df['orcamento']= df['orcamento'].drop_outliers(),pois esses valores indicam desvios estatísticos significativos em relação à média ou à massa total dos dados.


E

remover duplicatas em projeto, usando o comando df.drop_duplicates (subset=None, keep=None, inplace=False), que verifica a coluna projeto e remove todos os registros duplicados diretamente sobre o Dataframe df.