Questões de Concurso sobre Análise Multivariada

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
84 questões encontradas
Questões por página
20
Mais recentes
 

Martinha, uma analista da ALEGO, desenvolveu o programa Python (versão 3) que utiliza as bibliotecas numpy (2.0.2) e scikitlearn (versão 1.6.1) para realizar análise discriminante linear. Analise o programa a seguir.


import numpy as np

from sklearn.discriminant_analysis import

LinearDiscriminantAnalysis

X = np.array([[-1, -1], [-2, -1], [-3, -2],

[1, 1], [2, 1], [3, 2], [1, 2]])

y = np.array([1, 1, 1, 2, 2, 2, 2])

clf = LinearDiscriminantAnalysis()

clf.fit(X, y)

print(clf.predict([[-0.8, -2]]))


O resultado impresso é igual a


A

[0].


B

[1].


C

[2].


D

[3]


E

[-1].

Considere as seguintes afirmativas sobre algoritmos e técnicas utilizadas em aprendizado não supervisionado, especialmente no contexto de clusterização:


I. K-Means, DBSCAN e Gaussian Mixture Models (GMM) são métodos amplamente empregados para tarefas de clusterização, embora se baseiem em pressupostos estatísticos e geométricos distintos.

II. DBSCAN e Mean-Shift são algoritmos que não exigem a definição prévia do número de clusters, pois os identificam implicitamente, a partir da densidade dos dados ou da estimação de modos da distribuição.

III. Critérios de informação como Akaike Information Criterion (AIC) e Bayesian Information Criterion (BIC), bem como heurísticas como o método do Elbow, são utilizados como técnicas auxiliares para apoiar a escolha do número adequado de clusters em determinados algoritmos.


É (são) verdadeira(s) a(s) alternativa(s):


A

I, apenas.


B

I e II, apenas.


C

I, II e III.


D

II e III, apenas.


E

III, apenas.

A análise multivariada envolve o estudo simultâneo de múltiplas variáveis independentes para a identificação de padrões e relações nos dados.


C

Certo


E

Errado

A MANOVA é preferível à ANOVA univariada quando há mais de uma variável dependente, pois garante que todas as comparações entre grupos sejam significativas individualmente.


C

Certo


E

Errado

Com relação à detecção de anomalias, avalie as afirmativas a seguir e assinale (V) para verdadeira e (F) para falsa.


( ) A detecção de valor discrepante corresponde à identificação de uma observação, evento ou ponto de dados que representa um espaço vetorial multidimensional convexo e fixo, tornando-o inconsistente em relação ao resto do conjunto de dados.

( ) O aprendizado de máquina e a inteligência artificial são empregados para identificar automaticamente alterações inesperadas no comportamento normal de um conjunto de dados.

( ) As anomalias costumam ser raras e as características do comportamento normal podem ser complexas e dinâmicas, o que torna a detecção desafiadora.


As afirmativas são, respectivamente,


A

F – F – V.


B

V – F – F.


C

F – V – V.


D

V – F – V.


E

F – V – F.

Em uma nota técnica publicada em 2022 pelo Ipea, sobre população em situação de rua, foi utilizada a técnica de análise de componente principal (PCA).


Na análise por PCA, a primeira componente principal de um conjunto de dados representa a


A

média dos dados


B

mediana dos dados


C

soma total dos dados


D

variância máxima dos dados


E

correlação mínima entre os dados

A Análise de Componentes Principais (PCA) é uma técnica de transformação de dados que tem como objetivo encontrar as direções de maior variação nos dados, geralmente representadas pelos chamados componentes principais, e gerar novas representações dos dados.


Assinale o objetivo principal dessa técnica.


A

Discretização dos dados.


B

Redução da dimensionalidade dos dados.


C

Normalização dos dados.


D

Padronização dos dados.


E

Cálculo de distâncias entre os dados.

A análise dos dados multivariados, como a correlação linear entre dois atributos do conjunto de dados X, pode ser facilitada pelo uso do gráfico de:


A

pizza;


B

boxplot;


C

densidade;


D

histograma;


E

scatter plot.

Se X é um vetor p-dimensional com distribuição normal multivariada com vetor de médias e matriz de covariâncias e se A é uma matriz qxp constante, então AX tem distribuição normal multivariada com vetor de médias e matriz de covariâncias dados respectivamente por


A

e -1t


B

-1


C

-1


D


E

Sobre o uso de técnicas multivariadas na análise de dados, é correto afirmar:


A

O método de agrupamento k-means configura um algoritmo hierárquico.


B

Na análise fatorial, os fatores são expressos como combinações lineares das variáveis observadas.


C

A análise de variância multivariada (MANOVA) permite avaliar o efeito de múltiplos fatores em uma variável resposta.


D

A análise de correlação canônica é uma alternativa à análise de componentes principais para o caso em que as variáveis são categorizadas.


E

Na análise de componentes principais, o uso da matriz de correlações permite remover o efeito de diferentes escalas das variáveis observadas.

A ação de realizar agrupamento hierárquico tem como premissa básica encontrar elementos em um conjunto de dados que impliquem a presença de outros elementos na mesma transação, com um grau de certeza definido pelos índices de fator de suporte e o fator de confiança, que pode ser realizado, por exemplo, por meio do algoritmo a priori.


C

Certo


E

Errado

Suponha que X tenha distribuição normal com média μ e variância σ2. Considere uma amostra aleatória X1, X2 e X3.


Dos estimadores da média populacional a seguir, assinale o que é viesado.


A

.


B

.


C

.


D

.


E

.

Quanto à análise multivariada,


A

um dos objetivos da análise de componentes principais é o aumento da dimensionalidade dos dados.


B

na análise discriminante não é necessário conhecer previamente os grupos para obter uma função discriminante a ser usada para alocar os novos elementos.


C

na regressão logística, uma premissa básica é a ausência de homoscedasticidade nos resíduos.


D

na análise de conglomerados, uma forma de representar graficamente o processo de agrupamento hierárquico é por meio do dendrograma.


E

na análise discriminante, não é considerado um pressuposto a ausência de multicolinearidade das variáveis explicativas.

As variáveis aleatórias X e Y são tais que 𝑉𝑎𝑟(𝑋) = 1, 𝑉𝑎𝑟(𝑌) = 4 e 𝐶𝑜𝑣(𝑋, 𝑌) = −1.


O valor de 𝑉𝑎𝑟(𝑌 − 2𝑋) é:


A

0;


B

4;


C

6;


D

8;


E

12.

Existem diversas formas de analisar os resultados de estudos da área de saúde. Em relação a esse tipo de análise, avalie as seguintes informações: o valor da odds ratio (OR) e seu respectivo intervalo de 95% de confiança (IC) para o fator de risco X e sua relação com a ocorrência de câncer de pulmão foi: OR=1,5; IC = (0,95: 2,51) entre os homens e, OR=2,5; IC = (1,5: 4,6) entre as mulheres.


Com base nesses dados, identifique a alternativa correta.


A

X é fator de risco estatisticamente maior entre as mulheres para desenvolver câncer de pulmão.


B

X não é fator de risco para desenvolver câncer de pulmão entre os homens.


C

X é fator de risco para desenvolver câncer de pulmão tanto entre os homens quanto entre as mulheres.


D

É preciso saber o tamanho da amostra para concluir a análise sobre a OR.


E

X é fator de proteção para desenvolver câncer de pulmão entre os homens.

Considerando as diversas técnicas de análise multivariada, identifique a alternativa incorreta.


A

Análise discriminante é uma técnica utilizada para classificação de elementos de uma amostra em caso de grupos que já tenham sido pré-definidos.


B

Em análise discriminante, para o caso de 2 grupos, uma regra de classificação bastante usada, na prática, é a razão de verossimilhança.


C

O propósito essencial da análise fatorial é descrever a variabilidade original do vetor de variáveis em termos de um número menor de variáveis chamadas de fatores.


D

A correlação canônica pode ser vista como uma extensão da regressão múltipla.


E

Na correlação canônica, só existe uma variável dependente.

Em relação à distribuição Normal, assinale V para a afirmativa verdadeira e F para a falsa.


( ) Se X segue uma distribuição Normal, então a média é igual à mediana e igual à moda.

( ) Quando o tamanho da amostra é grande, a distribuição normal serve como aproximação da distribuição binomial.

( ) Quanto menor a variância, mais achatada é a função densidade de probabilidade da distribuição Normal.


As afirmativas são, respectivamente,


A

V – V – V


B

V – V – F.


C

V – F – V.


D

F – V – V.


E

F – V – F.

Com relação à técnica multivariada de componentes principais, avalie as seguintes afirmativas.


1) O método de componentes principais não é invariante a mudanças de escala.

2) A técnica de componentes principais consiste em uma transformação ortogonal dos eixos coordenados do sistema multivariado, buscando as orientações de menor variabilidade.

3) A análise de componentes principais consiste em reescrever as variáveis originais em novas variáveis denominadas componentes principais, através de uma transformação de coordenadas.

4) A análise de componentes principais está relacionada com a explicação da estrutura de covariância por meio de poucas combinações lineares das variáveis originais em estudo.


Estão corretas, apenas:


A

1, 3 e 4.


B

1, 2 e 3.


C

2 e 4.


D

1 e 4.


E

2 e 3.

Sobre os métodos de estatística multivariada, é INCORRETO afirmar que:


A

As técnicas de agrupamento não hierárquicas, como o método das K-médias, necessitam que o número de grupos (clusters) seja predeterminado.


B

O método de agrupamento hierárquico de Ward busca, dentre os possíveis agrupamentos de dois grupos, unir aqueles que resultem na menor variância global, a qual é minimizada se a distância euclidiana ao quadrado é empregada.


C

Na análise de componentes principais, supõe-se que as componentes não são correlacionadas entre si. A variância de cada componente principal é igual ao autovalor da matriz de covariâncias associado a ela e cada variável presente no conjunto de dados deve ficar associada a uma única componente principal.


D

Na análise fatorial, a aplicação de uma rotação ortogonal não altera as comunalidades nem as variâncias específicas, mas pode alterar os percentuais de explicação dos fatores. Além disso, segundo o critério de Kaiser, a escolha do número de fatores é baseada no número de autovalores da matriz de covariância que são maiores ou iguais a 1.

 
 
Gerar simulado