Questões de Concurso sobre Análise exploratória de dados

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
70 questões encontradas
Questões por página
20
Mais recentes
 

Em se tratando de análises de tendências e projeções, desconsideram-se atributos como sazonalidade, autocorrelação e granularidade temporal quando utilizados modelos estatísticos consolidados.


C

Certo


E

Errado

Acerca dos princípios e de boas práticas de visualização de dados e painéis de monitoramento, julgue o item a seguir.


Ao olho humano a continuidade da linha é percebida como a progressão do tempo e a conexão entre eventos, de modo que gráficos de linhas são as ferramentas ideais para representar séries temporais.


C

Certo


E

Errado

Em Python, utilizando bibliotecas de visualização de dados, um setor de fiscalização compara valores de autos de infração por tipo de tributo para identificar assimetria e possíveis outliers de forma padronizada. Nesse caso, a técnica de visualização que atende corretamente ao requisito apresentado é:


A

Gráfico de área empilhada por tributo, destacando proporções relativas.


B

Flexplot por dispersão com jitter sem estatística resumida por categoria.


C

Gráfico de linhas, usando o tipo de tributo no eixo X para sugerir continuidade.


D

Boxplot por categoria com Seaborn, permitindo comparar quartis e outliers entre tributos.


E

Gráfico de barras de médias por tributo, pois a média é suficiente para detectar outliers.

Uma Secretaria da Fazenda estadual recebeu dados de todos os lançamentos de ICMS dos últimos 5 anos (valores, setores econômicos, municípios, regime tributário e situação do contribuinte). Antes de construir modelos preditivos de risco ou definir novas regras de fiscalização, a equipe decide realizar apenas uma etapa sistemática de resumo, visualização e detecção de padrões e outliers nos dados, sem ainda formular hipóteses formais ou treinar modelos. Esse trabalho inicial e caracterizado como


A

um exemplo de analytics prescritivo, pois o objetivo principal é recomendar ações específicas de fiscalização para cada contribuinte.


B

uma etapa de mineração de dados preditiva, focada em gerar automaticamente modelos de classificação de contribuintes de alto risco.


C

um processo típico de OLAP, em que se navega em cubos com dados consolidados, sem foco em gráficos e exploração detalhada de outliers.


D

uma etapa de análise exploratória de dados, focada em medidas-resumo e visualizações para entender distribuições e relações entre variáveis.


E

uma tarefa de aprendizado supervisionado, pois pressupõe rótulos de “fraude” ou “não fraude” para cada lançamento tributário.

Ao analisar grandes volumes de notas fiscais eletrônicas para apóio à fiscalização estadual, uma equipe de TI aplica estatística descritiva para compreender o comportamento dos valores declarados por contribuintes, considerando distribuições assimeétricas, presença de valores extremos e necessidade de subsidiar modelos de inteligência artificial. A aplicação tecnicamente adequada das medidas de tendência central e de dispersão nesse cenário ocorre quando se


A

adota a moda como principal medida de tendência central para séries numéricas contínuas, associando-a à variância como medida de dispersão, por refletirem com maior precisão o comportamento predominante dos dados fiscais.


B

prioriza o uso do desvio padrão, o qual substitui outras medidas de dispersão, porque assim, assumindo normalidade implícita dos dados e empregando a média ponderada para reduzir o impacto de outliers na análise fiscal, as medidas serão precisas.


C

aplicam a média e a variância após exclusão prévia de valores extremos, garantindo homogeneidade da amostra, e se utiliza a amplitude total como medida suficiente para caracterizar a dispersão dos dados e a dessincronização dos parâmetros que interferem nas medições.


D

combina a mediana como medida de tendência central mais robusta em distribuições assimétricas com a utilização do intervalo interquartil como medida de dispersão, reduzindo a influência de valores extremos e fornecendo base estatística mais estável para análises exploratórias e modelos analíticos de fiscalização.


E

utiliza a média aritmética como medida representativa dos valores fiscais, complementando a análise com o desvio padrão, mesmo em distribuições assimétricas, por ser a abordagem mais utilizada em sistemas analíticos corporativos.

O boxplot (diagrama de caixa) é uma ferramenta de visualização que possibilita identificar a mediana, a dispersão dos dados e a presença de valores atípicos (outliers) em uma distribuição.


C

Certo


E

Errado

A análise PCA (análise de componentes principais) é utilizada para simplificar os dados e reduzir o ruído, pois tende a equilibrar as dimensões que têm valores mais extremos (outliers).


C

Certo


E

Errado

Certo banco de dados no R é constituído de informações sobre adultos, crianças e adolescentes. Após uma consulta ao banco mostrar que algumas pessoas trazem a informação NA (Not Available) no campo idade, qual função exclui os dados dessas pessoas?


A

> dados < − dados[dim(dados$idade)].


B

> dados < − dados[head(dados$idade)].


C

> dados < − dados[summary(dados$idade)].


D

> dados < − dados[complete.cases(dados$idade)].

Ciência de Dados (CD) utiliza conjuntos de dados para tentar entender e resolver problemas do mundo real. Com relação aos fundamentos essenciais da CD, analise as afirmativas a seguir.


I. Os dados figuram como o elemento central. O objetivo é extrair desses toda informação possível para que se possam tomar decisões e antecipar resultados de maneira precisa.

II. Não é campo de conhecimento alheio às outras ciências. Ao contrário, que se trata de uma combinação de instrumentos fornecidos por diversos campos do saber, com destaque para a Estatística e a Ciência da Computação.

III. CD lida exclusivamente com a análise de dados estruturados, como planilhas e bancos de dados SQL, focando apenas em visualizações básicas e relatórios descritivos.


Está correto o que se afirma em


A

I, II, III.


B

II e III, apenas.


C

I e II, apenas.


D

III, apenas.


E

II, apenas.

O uso do modelo associativo da ferramenta Qlik permite que a INFRA S.A. explore dados de múltiplas fontes sem a necessidade de caminhos de navegação previamente definidos, favorecendo análises exploratórias.


C

Certo


E

Errado

Analise o notebook abaixo, obtido pela exportação estruturada em texto feita no Jupyter Notebook.


Imagem associada para resolução da questão


Diante do exposto, analise as afirmativas abaixo.

I. A célula 4 do Notebook gera uma análise descritiva ou resumo dos dados. Para variáveis numéricas obtém-se count, mean, std, min, max, Q1, Q2, Q3. O comando da célula 3 mostra as cinco primeiras linhas do Dataframe.

II. Housing_path é a pasta onde estão os dados no formato <working directory/datasets/housing/>, onde working directory pode ser obtido pelo comando os.getcwd().

III. A função hist() gera histogramas que utiliza a biblioteca matplotlib. Ela utiliza o parâmetro bins, que é a resolução do gráfico, e figsize para o tamanho da figura no formato largura/altura em polegadas.


Estão corretas as afirmativas:


A

I e II apenas


B

I apenas


C

II e III apenas


D

I, II e III

A AED deve ser concluída antes da modelagem estatística ou do aprendizado de máquina, de forma a não interferir, com redirecionamentos ou revisões interpretativas, no processo posterior.


C

Certo


E

Errado

A distância de Mahalanobis é uma medida estatística que indica quantos desvios‑padrão um determinado valor está da média. Ela é utilizada para identificar outliers em dados multidimensionais.


C

Certo


E

Errado

Durante uma análise exploratória de dados (EDA), um cientista de dados está avaliando a dispersão de um conjunto de dados financeiros que contém informações sobre variações diárias no preço de uma ação. Ele deseja utilizar uma métrica que atenda os seguintes requisitos:


• Leve em conta todos os valores da amostra para evitar que outliers distorçam excessivamente a análise.

• Seja expressa na mesma unidade de medida dos dados originais, facilitando a interpretação dos resultados.

• Permita comparar a variabilidade entre diferentes ativos, mesmo que tenham médias diferentes.


Dado esse contexto, assinale a alternativa que apresenta a técnica estatística que melhor atende aos requisitos mencionados.


A

Variância populacional.


B

Desvio padrão amostral.


C

Amplitude interquartil (IQR).


D

Coeficiente de curtose.


E

Média ponderada.

O gráfico de dispersão pode ser uma ferramenta útil para explorar a relação entre as variáveis, possibilitando uma análise visual inicial; no entanto, técnicas adicionais, como suavização por regressão local, transformação de variáveis ou o uso de gráficos alternativos (como histogramas bivariados), podem ser necessárias para revelar padrões mais claramente.


C

Certo


E

Errado

Um professor do IFPE é coordenador do projeto de monitoramento do rio Capibaribe em Recife-PE, ele utiliza séries temporais que incluem as variáveis nível_chuva (medido em mm), cota_rio (medido em cm) e turbidez_agua (medido de 1 a 4000 NTUs). Durante a fase de exploração, a equipe de análise de dados constatou que:


● Todas as três variáveis possuem valores ausentes de forma esparsa.

● Existe uma forte correlação multivariada (não necessariamente linear) entre as variáveis. Por exemplo, a cota e a turbidez aumentam significativamente após chuvas intensas.

● A distribuição da variável cota_rio é assimétrica, com a presença de outliers significativos que representam eventos de cheias extremas.


Considerando esse cenário, a equipe decidiu usar uma técnica de imputação. A técnica mais robusta e apropriada para preservar a estrutura e as relações intrínsecas dos dados é:


A

Imputação pela mediana.


B

Imputação pela média.


C

Imputação por um valor constante, como zero.


D

Imputação por interpolação linear simples.


E

Imputação usando KNN.

A utilização de gráficos de dispersão e histogramas em grandes conjuntos de dados permite visualizar a distribuição das variáveis e a correlação entre elas; a escolha das variáveis independentes e dependentes influencia a percepção de tendências e padrões.


C

Certo


E

Errado

 
 
Gerar simulado