Questões de Concurso sobre Análise exploratória de dados

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
70 questões encontradas
Questões por página
20
Mais recentes
 

Uma Secretaria da Fazenda estadual recebeu dados de todos os lançamentos de ICMS dos últimos 5 anos (valores, setores econômicos, municípios, regime tributário e situação do contribuinte). Antes de construir modelos preditivos de risco ou definir novas regras de fiscalização, a equipe decide realizar apenas uma etapa sistemática de resumo, visualização e detecção de padrões e outliers nos dados, sem ainda formular hipóteses formais ou treinar modelos. Esse trabalho inicial e caracterizado como


A

um exemplo de analytics prescritivo, pois o objetivo principal é recomendar ações específicas de fiscalização para cada contribuinte.


B

uma etapa de mineração de dados preditiva, focada em gerar automaticamente modelos de classificação de contribuintes de alto risco.


C

um processo típico de OLAP, em que se navega em cubos com dados consolidados, sem foco em gráficos e exploração detalhada de outliers.


D

uma etapa de análise exploratória de dados, focada em medidas-resumo e visualizações para entender distribuições e relações entre variáveis.


E

uma tarefa de aprendizado supervisionado, pois pressupõe rótulos de “fraude” ou “não fraude” para cada lançamento tributário.

Em Python, utilizando bibliotecas de visualização de dados, um setor de fiscalização compara valores de autos de infração por tipo de tributo para identificar assimetria e possíveis outliers de forma padronizada. Nesse caso, a técnica de visualização que atende corretamente ao requisito apresentado é:


A

Gráfico de área empilhada por tributo, destacando proporções relativas.


B

Flexplot por dispersão com jitter sem estatística resumida por categoria.


C

Gráfico de linhas, usando o tipo de tributo no eixo X para sugerir continuidade.


D

Boxplot por categoria com Seaborn, permitindo comparar quartis e outliers entre tributos.


E

Gráfico de barras de médias por tributo, pois a média é suficiente para detectar outliers.

Em se tratando de análises de tendências e projeções, desconsideram-se atributos como sazonalidade, autocorrelação e granularidade temporal quando utilizados modelos estatísticos consolidados.


C

Certo


E

Errado

Acerca dos princípios e de boas práticas de visualização de dados e painéis de monitoramento, julgue o item a seguir.


Ao olho humano a continuidade da linha é percebida como a progressão do tempo e a conexão entre eventos, de modo que gráficos de linhas são as ferramentas ideais para representar séries temporais.


C

Certo


E

Errado

Ao analisar grandes volumes de notas fiscais eletrônicas para apóio à fiscalização estadual, uma equipe de TI aplica estatística descritiva para compreender o comportamento dos valores declarados por contribuintes, considerando distribuições assimeétricas, presença de valores extremos e necessidade de subsidiar modelos de inteligência artificial. A aplicação tecnicamente adequada das medidas de tendência central e de dispersão nesse cenário ocorre quando se


A

adota a moda como principal medida de tendência central para séries numéricas contínuas, associando-a à variância como medida de dispersão, por refletirem com maior precisão o comportamento predominante dos dados fiscais.


B

prioriza o uso do desvio padrão, o qual substitui outras medidas de dispersão, porque assim, assumindo normalidade implícita dos dados e empregando a média ponderada para reduzir o impacto de outliers na análise fiscal, as medidas serão precisas.


C

aplicam a média e a variância após exclusão prévia de valores extremos, garantindo homogeneidade da amostra, e se utiliza a amplitude total como medida suficiente para caracterizar a dispersão dos dados e a dessincronização dos parâmetros que interferem nas medições.


D

combina a mediana como medida de tendência central mais robusta em distribuições assimétricas com a utilização do intervalo interquartil como medida de dispersão, reduzindo a influência de valores extremos e fornecendo base estatística mais estável para análises exploratórias e modelos analíticos de fiscalização.


E

utiliza a média aritmética como medida representativa dos valores fiscais, complementando a análise com o desvio padrão, mesmo em distribuições assimétricas, por ser a abordagem mais utilizada em sistemas analíticos corporativos.

O boxplot (diagrama de caixa) é uma ferramenta de visualização que possibilita identificar a mediana, a dispersão dos dados e a presença de valores atípicos (outliers) em uma distribuição.


C

Certo


E

Errado

A análise PCA (análise de componentes principais) é utilizada para simplificar os dados e reduzir o ruído, pois tende a equilibrar as dimensões que têm valores mais extremos (outliers).


C

Certo


E

Errado

Certo banco de dados no R é constituído de informações sobre adultos, crianças e adolescentes. Após uma consulta ao banco mostrar que algumas pessoas trazem a informação NA (Not Available) no campo idade, qual função exclui os dados dessas pessoas?


A

> dados < − dados[dim(dados$idade)].


B

> dados < − dados[head(dados$idade)].


C

> dados < − dados[summary(dados$idade)].


D

> dados < − dados[complete.cases(dados$idade)].

Ciência de Dados (CD) utiliza conjuntos de dados para tentar entender e resolver problemas do mundo real. Com relação aos fundamentos essenciais da CD, analise as afirmativas a seguir.


I. Os dados figuram como o elemento central. O objetivo é extrair desses toda informação possível para que se possam tomar decisões e antecipar resultados de maneira precisa.

II. Não é campo de conhecimento alheio às outras ciências. Ao contrário, que se trata de uma combinação de instrumentos fornecidos por diversos campos do saber, com destaque para a Estatística e a Ciência da Computação.

III. CD lida exclusivamente com a análise de dados estruturados, como planilhas e bancos de dados SQL, focando apenas em visualizações básicas e relatórios descritivos.


Está correto o que se afirma em


A

I, II, III.


B

II e III, apenas.


C

I e II, apenas.


D

III, apenas.


E

II, apenas.

O uso do modelo associativo da ferramenta Qlik permite que a INFRA S.A. explore dados de múltiplas fontes sem a necessidade de caminhos de navegação previamente definidos, favorecendo análises exploratórias.


C

Certo


E

Errado

Analise o notebook abaixo, obtido pela exportação estruturada em texto feita no Jupyter Notebook.


Imagem associada para resolução da questão


Diante do exposto, analise as afirmativas abaixo.

I. A célula 4 do Notebook gera uma análise descritiva ou resumo dos dados. Para variáveis numéricas obtém-se count, mean, std, min, max, Q1, Q2, Q3. O comando da célula 3 mostra as cinco primeiras linhas do Dataframe.

II. Housing_path é a pasta onde estão os dados no formato <working directory/datasets/housing/>, onde working directory pode ser obtido pelo comando os.getcwd().

III. A função hist() gera histogramas que utiliza a biblioteca matplotlib. Ela utiliza o parâmetro bins, que é a resolução do gráfico, e figsize para o tamanho da figura no formato largura/altura em polegadas.


Estão corretas as afirmativas:


A

I e II apenas


B

I apenas


C

II e III apenas


D

I, II e III

A AED deve ser concluída antes da modelagem estatística ou do aprendizado de máquina, de forma a não interferir, com redirecionamentos ou revisões interpretativas, no processo posterior.


C

Certo


E

Errado

A utilização de gráficos de dispersão e histogramas em grandes conjuntos de dados permite visualizar a distribuição das variáveis e a correlação entre elas; a escolha das variáveis independentes e dependentes influencia a percepção de tendências e padrões.


C

Certo


E

Errado

A distância de Mahalanobis é uma medida estatística que indica quantos desvios‑padrão um determinado valor está da média. Ela é utilizada para identificar outliers em dados multidimensionais.


C

Certo


E

Errado

Durante uma análise exploratória de dados (EDA), um cientista de dados está avaliando a dispersão de um conjunto de dados financeiros que contém informações sobre variações diárias no preço de uma ação. Ele deseja utilizar uma métrica que atenda os seguintes requisitos:


• Leve em conta todos os valores da amostra para evitar que outliers distorçam excessivamente a análise.

• Seja expressa na mesma unidade de medida dos dados originais, facilitando a interpretação dos resultados.

• Permita comparar a variabilidade entre diferentes ativos, mesmo que tenham médias diferentes.


Dado esse contexto, assinale a alternativa que apresenta a técnica estatística que melhor atende aos requisitos mencionados.


A

Variância populacional.


B

Desvio padrão amostral.


C

Amplitude interquartil (IQR).


D

Coeficiente de curtose.


E

Média ponderada.

O gráfico de dispersão pode ser uma ferramenta útil para explorar a relação entre as variáveis, possibilitando uma análise visual inicial; no entanto, técnicas adicionais, como suavização por regressão local, transformação de variáveis ou o uso de gráficos alternativos (como histogramas bivariados), podem ser necessárias para revelar padrões mais claramente.


C

Certo


E

Errado

Um professor do IFPE é coordenador do projeto de monitoramento do rio Capibaribe em Recife-PE, ele utiliza séries temporais que incluem as variáveis nível_chuva (medido em mm), cota_rio (medido em cm) e turbidez_agua (medido de 1 a 4000 NTUs). Durante a fase de exploração, a equipe de análise de dados constatou que:


● Todas as três variáveis possuem valores ausentes de forma esparsa.

● Existe uma forte correlação multivariada (não necessariamente linear) entre as variáveis. Por exemplo, a cota e a turbidez aumentam significativamente após chuvas intensas.

● A distribuição da variável cota_rio é assimétrica, com a presença de outliers significativos que representam eventos de cheias extremas.


Considerando esse cenário, a equipe decidiu usar uma técnica de imputação. A técnica mais robusta e apropriada para preservar a estrutura e as relações intrínsecas dos dados é:


A

Imputação pela mediana.


B

Imputação pela média.


C

Imputação por um valor constante, como zero.


D

Imputação por interpolação linear simples.


E

Imputação usando KNN.

 
 
Gerar simulado