

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Uma equipe de planejamento da SEPLAG está preparando um conjunto de dados para análise em Python, usando Pandas. O DataFrame df contém informações sobre projetos estratégicos, incluindo colunas como projeto, responsavel, orcamento, prazo_dias e cpf_responsavel. Durante a análise exploratória, foram identificados valores ausentes em prazo_dias, duplicatas em projeto e valores extremos em orcamento.Além disso, os dados serão compartilhados com parceiros externos. Em condições ideais, uma prática que se adequa a este cenário é
criar os gráficos finais primeiro e realizar a análise exploratória em seguida, pois isso evita alterações nos dados que possam comprometer a visualização.
remover valores ausentes em prazo_dias, usando df.dropna (subset='prazo_dias'), o que garante que todos os registros com dados incompletos sejam eliminados.
aplicar um tipo de anonimização na coluna cpf_responsavel, utilizando um salt, com df['cpf_responsavel'] = df ['cpf_responsavel'].apply(lambda x: hash (salt + str(x)), o que converte os CPFs em identificadores não reversíveis e menos suscetíveis à reidentificação.
promover a detecção de outliers em orçamento, usando df['orcamento']= df['orcamento'].drop_outliers(),pois esses valores indicam desvios estatísticos significativos em relação à média ou à massa total dos dados.
remover duplicatas em projeto, usando o comando df.drop_duplicates (subset=None, keep=None, inplace=False), que verifica a coluna projeto e remove todos os registros duplicados diretamente sobre o Dataframe df.
Uma equipe de analistas de um Ministério Público está preparando um conjunto de dados contendo informações de denúncias. Parte do pré-processamento envolve o uso de técnicas de feature engineering para o tratamento de valores ausentes em colunas categóricas antes da aplicação de algoritmos de aprendizado de máquina. Para isso, foi desenvolvido o código abaixo.
import pandas as pd
# Pequeno conjunto de dados de exemplo
data = {
"tipo_denuncia": ["Ambiental", None, "Penal", "Penal", None],
"origem": ["Anonima", "Identificada", None, "Anonima", "Anonima"]
}
df = pd.DataFrame (data)
# Seleciona colunas categóricas
categorical_cols = df.select_dtypes (include=['object']).columns
# Substitui valores ausentes pela categoria mais frequente
for col in categorical_cols:
mode = df[col].mode () [0]
__I__
print (df)
Considerando que esse código será executado em condições ideais, o comando que deve preencher corretamente a lacuna I, para garantir que as variáveis categóricas tenham seus valores ausentes substituídos pela categoria mais frequente, é:
df[col].fillna(inplace=None, 'Desconhecido')
df[col].append(mode)
df[col] = df[col].fillna(mode)
df[col].dropna(inplace=1)
df[col] = df[col].replace(mode, None)
Uma equipe de Engenharia de Computação está pré-processando textos de relatórios de falhas de software para análise automática de tendências em processamento de linguagem natural. O primeiro passo no pré-processamento é dividir a frase em unidades menores para que o modelo possa analisá-las individualmente.
O processo inicial de PLN que consiste em dividir uma sequência de texto em unidades menores, como palavras, subpalavras ou sentenças é o(a)
Stemming.
Lemmatization.
Normalização.
Classificação de Texto.
Tokenização.
Ao utilizar a biblioteca Pandas em Python para realizar técnicas de limpeza e imputação em um DataFrame chamado dados, o analista encontra valores ausentes (NaN) na coluna de rendimentos. O método apropriado e direto do Pandas para substituir esses valores pela média da coluna é
dados['rendimento'].dropna(mean)
dados['rendimento'].replace(NaN, media)
dados['rendimento'].fillna(dados['rendimento'].mean())
dados['rendimento'].impute(method='mean')
dados['rendimento'].insert(mean, inplace=True)
Diante da integração de cadastros de contribuintes provenientes de múltiplos sistemas fiscais, sujeitos a divergências semânticas em relação à Classificação Nacional de Atividades Econômicas (CNAE), abreviações e classificações internas, e visando garantir rastreabilidade para auditoria e reprocessamento, a técnica de pré-processamento adequada ao cenário apresentado é
a remoção de registros divergentes para reduzir ruído, aplicando regra de survivorship para definição do registro mestre.
a compressão de dados históricos antes das validações para reduzir volume de processamento.
a padronização sintática (caixa, acentos, máscara) de campos textuais antes da carga analítica.
a deduplicação baseada nas chaves primárias dos sistemas de origem, mantendo divergências irreconciliáveis.
o enriquecimento semântico com dicionários de referência e regras de correspondência versionadas e auditáveis.
Analise as seguintes assertivas sobre o tratamento de dados faltantes na etapa de pré-processamento de dados:
I. Eliminar os objetos com valores faltantes é uma alternativa não indicada quando poucos atributos do objeto possuem valores ausentes, quando o número de atributos com valores ausentes varia muito entre os objetos ou quando o número de objetos que restarem forem poucos.
II. Preencher manualmente valores para os atributos com valores ausentes não é uma alternativa factível quando o número de objetos ou atributos com valores ausentes for muito grande.
III. Utilizar algum método ou heurística para automaticamente definir valores para atributos com valores ausentes é uma alternativa bastante utilizada.
Quais estão corretas?
Apenas I.
Apenas III.
Apenas I e II.
Apenas II e III.
I, II e III.
Em conjuntos de dados, é comum deparar-se com valores faltantes, que podem surgir por diversas razões, como erros na coleta, falhas de registro ou respostas omitidas. A presença desses valores pode comprometer a qualidade das análises e a eficácia dos modelos preditivos. Portanto, é essencial aplicar técnicas adequadas para lidar com essas lacunas de maneira eficaz. Qual técnica é apropriada para lidar com valores faltantes em um conjunto de dados?
Ignorar os valores faltantes durante a análise.
Substituir os valores faltantes pela média ou mediana da coluna.
Duplicar as linhas que contêm valores faltantes.
Remover as colunas que contêm valores faltantes.
O pré-processamento de dados, que inclui as etapas de limpeza e normalização, é opcional no tratamento de grandes volumes de dados, pois ferramentas modernas como o Spark conseguem lidar com dados brutos de forma eficiente.
Certo
Errado
Alguns algoritmos de mineração de dados requerem que os atributos sejam categóricos, o que impossibilita o uso direto de dados numéricos. Para contornar essa limitação, pode-se aplicar a discretização. Acerca desse processo, assinale a opção correta.
A discretização não é recomendada para atributos contínuos, pois reduz a capacidade dos algoritmos de aprender padrões úteis.
A discretização baseada em histograma utiliza os intervalos de frequência do histograma para segmentar os dados, e os valores são substituídos conforme a faixa em que se encontram.
A discretização baseada em entropia é uma função linear por meio da qual se busca maximizar o ganho de informação ao se dividir o conjunto de dados, obtendo-se intervalos com maior relevância para classificação.
A discretização por agrupamento atribui aleatoriamente os valores do atributo numérico a grupos fixos, sem levar em conta critérios ou similaridades entre os dados.
A técnica de encaixotamento (binning) substitui os valores de um atributo por limites máximos e mínimos arbitrários, desconsideradas a média e a mediana.
Em um pipeline de pré-processamento de linguagem natural aplicado ao domínio jurídico, a tokenização deve, necessariamente, ser precedida pela lematização, uma vez que a lematização opera sobre formas canônicas já segmentadas.
Certo
Errado
Um cientista de dados da Controladoria está preparando um dataset de despesas públicas para ser utilizado em um algoritmo de Machine Learning baseado em distâncias como K-Nearest Neighbors - KNN.
A coluna Valor_Despesa varia amplamente, com valores entre R$ 100,00 (mínimo) e R$ 5.000.000,00 (máximo).
Assinale a opção que indica a técnica de Normalização Numérica mais adequada para reescalonar os dados da coluna Valor_Despesa, para que todos os seus valores sejam mapeados para um intervalo fixo entre 0 e 1.
Discretização baseada em largura (Equal Width Binning).
Padronização (Standardization ou Z-Score).
Discretização baseada em frequência.
Codificação One-Hot Encoding.
Normalização Min-Max.
Uma equipe está trabalhando em um projeto de análise preditiva com base em dados estruturados provenientes de diferentes fontes de um Tribunal Regional do Trabalho. Durante a etapa de pré-processamento, o time precisa lidar com valores ausentes/altantes, escalonar os dados para uniformizar as unidades e selecionar as variáveis mais importantes para treinar um modelo supervisionado. Para realizar estas tarefas nesta etapa, a equipe deve
utilizar uma Convolutional Neural Network (CNN) para preencher valores ausentes, normalizar os dados com a técnica Principal Component Analysis (PCA) e realizar redução dimensional com regressão logística.
aplicar a imputação de valores ausentes, escalonar os dados utilizando-se CNN e identificar variáveis importantes por meio da análise de cluster k-means.
preencher os valores ausentes com imputação (média ou mediana), escalonar os dados com standard scaler e realizar a seleção de variáveis com base na importância de features calculada por um modelo de árvore de decisão.
remover diretamente todas as linhas com valores ausentes, normalizar os dados com decomposição em valores singulares (SVD) e utilizar o algoritmo k-means para selecionar variáveis mais relevantes.
usar o algoritmo supervisionado análise de cluster hierárquico (HCA) para prever valores ausentes, aplicar normalização z-score nos dados e calcular a importância das variáveis com uma rede neural profunda.
No decorrer do desenvolvimento de um sistema de suporte à decisão baseado em técnicas de aprendizado de máquina, a equipe de analistas de um tribunal identificou a necessidade de aplicar técnicas de pré-processamento aos dados disponíveis, que incluíam tanto registros tabulares quanto documentos em texto livre. Considerando as práticas de preparação de dados para algoritmos de IA/ML, o pré-processamento de dados estruturados e não estruturados consiste, respectivamente, em atividades como
implementação de redes neurais e classificação supervisionada.
compressão de arquivos e criptografia de registros.
normalização de variáveis e tokenização de textos.
execução de auditoria de sistemas e clusterização de bases.
autenticação de usuários e mineração de dados sensíveis.
Um pesquisador da área de Processamento de Linguagem Natural comparou duas abordagens de pré-processamento: uma usando apenas remoção de stop words e outra incluindo também stemming. Considerando seu objetivo e suas implicações, é correto afirmar que o stemming
aumenta a dimensionalidade do vocabulário, tornando o modelo mais especializado no corpus.
preserva a estrutura gramatical das sentenças, facilitando análises sintáticas.
reduz a variabilidade de palavras relacionadas, facilitando a identificação de padrões comuns.
garante que palavras estejam presentes no léxico oficial.
minimiza perdas semânticas ao normalizar formas flexionadas sem alterar o significado.
Bins de frequência são utilizados na discretização.
Certo
Errado
A imputação por moda é uma técnica comumente utilizada no pré‑processamento de dados, para se lidar com valores ausentes.
Certo
Errado
Um pesquisador desenvolveu um estudo longitudinal para analisar o consumo de energia elétrica mensal de empresas do setor energético de determinada região, ao longo dos últimos 40 anos. Analisando a base de dados coletada, o pesquisador verificou que a base tinha vários dados faltantes e que necessitava utilizar alguma técnica de imputação de dados.
Assinale a opção que apresenta a técnica mais apropriada para o estudo do pesquisador.
A substituição por um valor de tendência central.
A predição por meio de um modelo de regressão linear simples.
O algoritmo EM.
O último valor observado.
O método de Monte Carlo.
O ciclo de vida de um processo de ciência de dados envolve uma série de etapas estruturadas que guiam o desenvolvimento de projetos de ciência de dados desde a definição do problema até a implementação e o monitoramento das soluções.
No ciclo de vida de um processo de ciência de dados, na fase de preparação de dados
são definidos os objetivos do projeto e formuladas as perguntas que o modelo deve responder.
o modelo é treinado e avaliado usando algoritmos de aprendizado de máquina.
são realizadas atividades como limpeza, transformação e formatação dos dados para garantir qualidade e adequação ao modelo.
os resultados são comunicados aos stakeholders por meio de visualizações e relatórios.
os dados são coletados diretamente dos usuários para garantir que o modelo esteja alinhado com as necessidades do público.
Em um projeto de mineração de dados para um banco de varejo que deseja prever a probabilidade de inadimplência de empréstimos, são coletados dados de clientes, incluindo histórico de crédito, renda, emprego e comportamento de pagamento. Ao preparar esses dados para análise, qual dos seguintes tipos de atributos é essencial para a modelagem preditiva da inadimplência?
Atributos nominais, como o tipo de emprego, que categorizam os clientes em grupos sem uma ordem intrínseca.
Atributos ordinais, como faixas de renda, que classificam os clientes em categorias com uma ordem ou classificação específica.
Atributos binários, como histórico de inadimplência (sim/não), que fornecem uma distinção clara na capacidade de pagamento do cliente.
Atributos de intervalo, como taxas de juros dos empréstimos, que medem quantidades em escalas contínuas, permitindo cálculos matemáticos.
Para desenvolver uma aplicação de Processamento de Linguagem Natural (PLN), é necessário realizar tarefas de pré-processamento no corpus de entrada, como a separação do texto em palavras. Observe a execução do seguinte fragmento de uma tarefa de PLN:
Entrada: “Bia é uma forte candidata do concurso da CVM.”
Saída: quantidade de unidades linguísticas = 14
A tarefa de PLN que faz a separação do texto em unidades linguísticas mínimas é a:
sentenciação;
tokenização;
lematização;
radicalização;
etiquetagem.