Questões de Concurso sobre Técnicas de pré-processamento

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
19 questões encontradas
Questões por página
20
Mais recentes
 

Uma equipe de planejamento da SEPLAG está preparando um conjunto de dados para análise em Python, usando Pandas. O DataFrame df contém informações sobre projetos estratégicos, incluindo colunas como projeto, responsavel, orcamento, prazo_dias e cpf_responsavel. Durante a análise exploratória, foram identificados valores ausentes em prazo_dias, duplicatas em projeto e valores extremos em orcamento.Além disso, os dados serão compartilhados com parceiros externos. Em condições ideais, uma prática que se adequa a este cenário é


A

criar os gráficos finais primeiro e realizar a análise exploratória em seguida, pois isso evita alterações nos dados que possam comprometer a visualização.


B

remover valores ausentes em prazo_dias, usando df.dropna (subset='prazo_dias'), o que garante que todos os registros com dados incompletos sejam eliminados.


C

aplicar um tipo de anonimização na coluna cpf_responsavel, utilizando um salt, com df['cpf_responsavel'] = df ['cpf_responsavel'].apply(lambda x: hash (salt + str(x)), o que converte os CPFs em identificadores não reversíveis e menos suscetíveis à reidentificação.


D

promover a detecção de outliers em orçamento, usando df['orcamento']= df['orcamento'].drop_outliers(),pois esses valores indicam desvios estatísticos significativos em relação à média ou à massa total dos dados.


E

remover duplicatas em projeto, usando o comando df.drop_duplicates (subset=None, keep=None, inplace=False), que verifica a coluna projeto e remove todos os registros duplicados diretamente sobre o Dataframe df.

Uma equipe de Engenharia de Computação está pré-processando textos de relatórios de falhas de software para análise automática de tendências em processamento de linguagem natural. O primeiro passo no pré-processamento é dividir a frase em unidades menores para que o modelo possa analisá-las individualmente.


O processo inicial de PLN que consiste em dividir uma sequência de texto em unidades menores, como palavras, subpalavras ou sentenças é o(a)


A

Stemming.


B

Lemmatization.


C

Normalização.


D

Classificação de Texto.


E

Tokenização.

Diante da integração de cadastros de contribuintes provenientes de múltiplos sistemas fiscais, sujeitos a divergências semânticas em relação à Classificação Nacional de Atividades Econômicas (CNAE), abreviações e classificações internas, e visando garantir rastreabilidade para auditoria e reprocessamento, a técnica de pré-processamento adequada ao cenário apresentado é


A

a remoção de registros divergentes para reduzir ruído, aplicando regra de survivorship para definição do registro mestre.


B

a compressão de dados históricos antes das validações para reduzir volume de processamento.


C

a padronização sintática (caixa, acentos, máscara) de campos textuais antes da carga analítica.


D

a deduplicação baseada nas chaves primárias dos sistemas de origem, mantendo divergências irreconciliáveis.


E

o enriquecimento semântico com dicionários de referência e regras de correspondência versionadas e auditáveis.

Analise as seguintes assertivas sobre o tratamento de dados faltantes na etapa de pré-processamento de dados:


I. Eliminar os objetos com valores faltantes é uma alternativa não indicada quando poucos atributos do objeto possuem valores ausentes, quando o número de atributos com valores ausentes varia muito entre os objetos ou quando o número de objetos que restarem forem poucos.

II. Preencher manualmente valores para os atributos com valores ausentes não é uma alternativa factível quando o número de objetos ou atributos com valores ausentes for muito grande.

III. Utilizar algum método ou heurística para automaticamente definir valores para atributos com valores ausentes é uma alternativa bastante utilizada.


Quais estão corretas?


A

Apenas I.


B

Apenas III.


C

Apenas I e II.


D

Apenas II e III.


E

I, II e III.

Em conjuntos de dados, é comum deparar-se com valores faltantes, que podem surgir por diversas razões, como erros na coleta, falhas de registro ou respostas omitidas. A presença desses valores pode comprometer a qualidade das análises e a eficácia dos modelos preditivos. Portanto, é essencial aplicar técnicas adequadas para lidar com essas lacunas de maneira eficaz. Qual técnica é apropriada para lidar com valores faltantes em um conjunto de dados?


A

Ignorar os valores faltantes durante a análise.


B

Substituir os valores faltantes pela média ou mediana da coluna.


C

Duplicar as linhas que contêm valores faltantes.


D

Remover as colunas que contêm valores faltantes.

O pré-processamento de dados, que inclui as etapas de limpeza e normalização, é opcional no tratamento de grandes volumes de dados, pois ferramentas modernas como o Spark conseguem lidar com dados brutos de forma eficiente.


C

Certo


E

Errado

Alguns algoritmos de mineração de dados requerem que os atributos sejam categóricos, o que impossibilita o uso direto de dados numéricos. Para contornar essa limitação, pode-se aplicar a discretização. Acerca desse processo, assinale a opção correta.


A

A discretização não é recomendada para atributos contínuos, pois reduz a capacidade dos algoritmos de aprender padrões úteis.


B

A discretização baseada em histograma utiliza os intervalos de frequência do histograma para segmentar os dados, e os valores são substituídos conforme a faixa em que se encontram.


C

A discretização baseada em entropia é uma função linear por meio da qual se busca maximizar o ganho de informação ao se dividir o conjunto de dados, obtendo-se intervalos com maior relevância para classificação.


D

A discretização por agrupamento atribui aleatoriamente os valores do atributo numérico a grupos fixos, sem levar em conta critérios ou similaridades entre os dados.


E

A técnica de encaixotamento (binning) substitui os valores de um atributo por limites máximos e mínimos arbitrários, desconsideradas a média e a mediana.

Em um pipeline de pré-processamento de linguagem natural aplicado ao domínio jurídico, a tokenização deve, necessariamente, ser precedida pela lematização, uma vez que a lematização opera sobre formas canônicas já segmentadas.


C

Certo


E

Errado

Uma equipe está trabalhando em um projeto de análise preditiva com base em dados estruturados provenientes de diferentes fontes de um Tribunal Regional do Trabalho. Durante a etapa de pré-processamento, o time precisa lidar com valores ausentes/altantes, escalonar os dados para uniformizar as unidades e selecionar as variáveis mais importantes para treinar um modelo supervisionado. Para realizar estas tarefas nesta etapa, a equipe deve


A

utilizar uma Convolutional Neural Network (CNN) para preencher valores ausentes, normalizar os dados com a técnica Principal Component Analysis (PCA) e realizar redução dimensional com regressão logística.


B

aplicar a imputação de valores ausentes, escalonar os dados utilizando-se CNN e identificar variáveis importantes por meio da análise de cluster k-means.


C

preencher os valores ausentes com imputação (média ou mediana), escalonar os dados com standard scaler e realizar a seleção de variáveis com base na importância de features calculada por um modelo de árvore de decisão.


D

remover diretamente todas as linhas com valores ausentes, normalizar os dados com decomposição em valores singulares (SVD) e utilizar o algoritmo k-means para selecionar variáveis mais relevantes.


E

usar o algoritmo supervisionado análise de cluster hierárquico (HCA) para prever valores ausentes, aplicar normalização z-score nos dados e calcular a importância das variáveis com uma rede neural profunda.

No decorrer do desenvolvimento de um sistema de suporte à decisão baseado em técnicas de aprendizado de máquina, a equipe de analistas de um tribunal identificou a necessidade de aplicar técnicas de pré-processamento aos dados disponíveis, que incluíam tanto registros tabulares quanto documentos em texto livre. Considerando as práticas de preparação de dados para algoritmos de IA/ML, o pré-processamento de dados estruturados e não estruturados consiste, respectivamente, em atividades como


A

implementação de redes neurais e classificação supervisionada.


B

compressão de arquivos e criptografia de registros.


C

normalização de variáveis e tokenização de textos.


D

execução de auditoria de sistemas e clusterização de bases.


E

autenticação de usuários e mineração de dados sensíveis.

Um pesquisador da área de Processamento de Linguagem Natural comparou duas abordagens de pré-processamento: uma usando apenas remoção de stop words e outra incluindo também stemming. Considerando seu objetivo e suas implicações, é correto afirmar que o stemming


A

aumenta a dimensionalidade do vocabulário, tornando o modelo mais especializado no corpus.


B

preserva a estrutura gramatical das sentenças, facilitando análises sintáticas.


C

reduz a variabilidade de palavras relacionadas, facilitando a identificação de padrões comuns.


D

garante que palavras estejam presentes no léxico oficial.


E

minimiza perdas semânticas ao normalizar formas flexionadas sem alterar o significado.

A imputação por moda é uma técnica comumente utilizada no pré‑processamento de dados, para se lidar com valores ausentes.


C

Certo


E

Errado

Ano: 2024
Prova: FGV - EPE - Analista - Área: Ciências de Dados - 2024

Um pesquisador desenvolveu um estudo longitudinal para analisar o consumo de energia elétrica mensal de empresas do setor energético de determinada região, ao longo dos últimos 40 anos. Analisando a base de dados coletada, o pesquisador verificou que a base tinha vários dados faltantes e que necessitava utilizar alguma técnica de imputação de dados.


Assinale a opção que apresenta a técnica mais apropriada para o estudo do pesquisador.


A

A substituição por um valor de tendência central.


B

A predição por meio de um modelo de regressão linear simples.


C

O algoritmo EM.


D

O último valor observado.


E

O método de Monte Carlo.

Em um projeto de mineração de dados para um banco de varejo que deseja prever a probabilidade de inadimplência de empréstimos, são coletados dados de clientes, incluindo histórico de crédito, renda, emprego e comportamento de pagamento. Ao preparar esses dados para análise, qual dos seguintes tipos de atributos é essencial para a modelagem preditiva da inadimplência?


A

Atributos nominais, como o tipo de emprego, que categorizam os clientes em grupos sem uma ordem intrínseca.


B

Atributos ordinais, como faixas de renda, que classificam os clientes em categorias com uma ordem ou classificação específica.


C

Atributos binários, como histórico de inadimplência (sim/não), que fornecem uma distinção clara na capacidade de pagamento do cliente.


D

Atributos de intervalo, como taxas de juros dos empréstimos, que medem quantidades em escalas contínuas, permitindo cálculos matemáticos.

Para desenvolver uma aplicação de Processamento de Linguagem Natural (PLN), é necessário realizar tarefas de pré-processamento no corpus de entrada, como a separação do texto em palavras. Observe a execução do seguinte fragmento de uma tarefa de PLN:


Entrada: “Bia é uma forte candidata do concurso da CVM.”

Saída: quantidade de unidades linguísticas = 14

A tarefa de PLN que faz a separação do texto em unidades linguísticas mínimas é a:


A

sentenciação;


B

tokenização;


C

lematização;


D

radicalização;


E

etiquetagem.

Assim como no caso das outras tarefas de mineração de dados, a mineração de regras de associação também pode ser executada por diferentes algoritmos, sendo que muitos deles são variações e melhorias de um algoritmo pioneiro, o processo geral de minerar regras de associação está dividido em quatro passos. Com relação ao passo de pré-processamento da base, assinale a alternativa correta.


A

O pré-processamento envolve etapas como: limpeza, integração, redução, transformação e discretização, a preparação de uma base transacional para a mineração de regras pode exigir que essa base seja transformada em uma base binária ou baseada em frequência


B

O pré-processamento envolve gerar um conjunto de itens frequentes, são aqueles que satisfazem algum critério mínimo de frequência, por exemplo, itens que aparecem ao menos em determinado número de transações


C

O pré-processamento envolve a criação de regras de associação, estas regras são geradas em uma etapa específica usando apenas os itens frequentes da base


D

O pré-processamento envolve a criação de regras de associação, que devem ser avaliadas utilizando-se diferentes medidas de interesse, dependendo do contexto

A análise de dados depende diretamente de dados representativos, válidos e sem viés. Assinale a alternativa correta relativa às técnicas de pré-processamento de dados.


A

Remover todas as colunas que possuem valores nulos ou faltantes.


B

Transformar atributos numéricos em nominais, pois os algoritmos têm um melhor desempenho com texto.


C

Manter os dados como nas fontes originais, permitindo haver escalas de ordens de grandezas diferentes.


D

Remover outliers se os valores estiverem fora do intervalo estatístico esperado quando eles podem influenciar negativamente o resultado da análise.


E

Remover todas as colunas que possuem pelo menos um valor inválido.

Durante a etapa do pré-processamento da base de dados, a análise de Outliers é uma tarefa comum e relevante para obter modelos de aprendizado de máquina consistentes. A presença de outliers pode levar a modelos imprecisos quando o modelo é testado ou colocado em produção. Analise as assertivas a seguir e assinale a alternativa correta.


I. Outliers são dados com padrões muito diferentes aos demais, que fogem ao padrão dos dados. Estes dados precisam ser identificados e analisados.

II. Outliers podem ser produzidos por erros de medição, valores default assumidos durante o preenchimento de uma base de dados ou podem corresponder a valores corretos, mas pertencentes a uma base de dados desbalanceada.

III. Na prática, os outliers comumente são eliminados. Porém, pode-se estar negligenciando um conjunto de instâncias que podem trazer novos conhecimentos acerca do domínio de problema.

IV. A detecção de outliers pode ser feita por meio de técnicas univariadas, que consistem em explorar cada atributo e variabilidade dos valores em torno da média. Quando a variabilidade é grande, pode indicar registros, potenciais outliers.


A

Todas estão corretas.


B

Todas estão incorretas.


C

Apenas II e IV estão corretas.


D

Apenas I, II e III estão corretas.


E

Apenas II, III e IV estão corretas.

 
 
Gerar simulado