

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Martinha, uma analista da ALEGO, desenvolveu o programa Python (versão 3) que utiliza as bibliotecas numpy (2.0.2) e scikitlearn (versão 1.6.1) para realizar análise discriminante linear. Analise o programa a seguir.
import numpy as np
from sklearn.discriminant_analysis import
LinearDiscriminantAnalysis
X = np.array([[-1, -1], [-2, -1], [-3, -2],
[1, 1], [2, 1], [3, 2], [1, 2]])
y = np.array([1, 1, 1, 2, 2, 2, 2])
clf = LinearDiscriminantAnalysis()
clf.fit(X, y)
print(clf.predict([[-0.8, -2]]))
O resultado impresso é igual a
[0].
[1].
[2].
[3]
[-1].
Considere as seguintes afirmativas sobre algoritmos e técnicas utilizadas em aprendizado não supervisionado, especialmente no contexto de clusterização:
I. K-Means, DBSCAN e Gaussian Mixture Models (GMM) são métodos amplamente empregados para tarefas de clusterização, embora se baseiem em pressupostos estatísticos e geométricos distintos.
II. DBSCAN e Mean-Shift são algoritmos que não exigem a definição prévia do número de clusters, pois os identificam implicitamente, a partir da densidade dos dados ou da estimação de modos da distribuição.
III. Critérios de informação como Akaike Information Criterion (AIC) e Bayesian Information Criterion (BIC), bem como heurísticas como o método do Elbow, são utilizados como técnicas auxiliares para apoiar a escolha do número adequado de clusters em determinados algoritmos.
É (são) verdadeira(s) a(s) alternativa(s):
I, apenas.
I e II, apenas.
I, II e III.
II e III, apenas.
III, apenas.
A análise multivariada envolve o estudo simultâneo de múltiplas variáveis independentes para a identificação de padrões e relações nos dados.
Certo
Errado
A MANOVA é preferível à ANOVA univariada quando há mais de uma variável dependente, pois garante que todas as comparações entre grupos sejam significativas individualmente.
Certo
Errado
Com relação à detecção de anomalias, avalie as afirmativas a seguir e assinale (V) para verdadeira e (F) para falsa.
( ) A detecção de valor discrepante corresponde à identificação de uma observação, evento ou ponto de dados que representa um espaço vetorial multidimensional convexo e fixo, tornando-o inconsistente em relação ao resto do conjunto de dados.
( ) O aprendizado de máquina e a inteligência artificial são empregados para identificar automaticamente alterações inesperadas no comportamento normal de um conjunto de dados.
( ) As anomalias costumam ser raras e as características do comportamento normal podem ser complexas e dinâmicas, o que torna a detecção desafiadora.
As afirmativas são, respectivamente,
F – F – V.
V – F – F.
F – V – V.
V – F – V.
F – V – F.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
Em uma nota técnica publicada em 2022 pelo Ipea, sobre população em situação de rua, foi utilizada a técnica de análise de componente principal (PCA).
Na análise por PCA, a primeira componente principal de um conjunto de dados representa a
média dos dados
mediana dos dados
soma total dos dados
variância máxima dos dados
correlação mínima entre os dados
A Análise de Componentes Principais (PCA) é uma técnica de transformação de dados que tem como objetivo encontrar as direções de maior variação nos dados, geralmente representadas pelos chamados componentes principais, e gerar novas representações dos dados.
Assinale o objetivo principal dessa técnica.
Discretização dos dados.
Redução da dimensionalidade dos dados.
Normalização dos dados.
Padronização dos dados.
Cálculo de distâncias entre os dados.
Caso fosse adicionada mais uma variável ao modelo, então, necessariamente o grau de ajuste do modelo aumentaria.
Certo
Errado
A análise dos dados multivariados, como a correlação linear entre dois atributos do conjunto de dados X, pode ser facilitada pelo uso do gráfico de:
pizza;
boxplot;
densidade;
histograma;
scatter plot.
Se X é um vetor p-dimensional com distribuição normal multivariada com vetor de médias μ e matriz de covariâncias ∑ e se A é uma matriz qxp constante, então AX tem distribuição normal multivariada com vetor de médias e matriz de covariâncias dados respectivamente por
Aμ e A∑-1At
Aμ e At∑-1 A
μ e ∑-1
μ e At∑A
Aμ e At∑A


Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Sobre o uso de técnicas multivariadas na análise de dados, é correto afirmar:
O método de agrupamento k-means configura um algoritmo hierárquico.
Na análise fatorial, os fatores são expressos como combinações lineares das variáveis observadas.
A análise de variância multivariada (MANOVA) permite avaliar o efeito de múltiplos fatores em uma variável resposta.
A análise de correlação canônica é uma alternativa à análise de componentes principais para o caso em que as variáveis são categorizadas.
Na análise de componentes principais, o uso da matriz de correlações permite remover o efeito de diferentes escalas das variáveis observadas.
A ação de realizar agrupamento hierárquico tem como premissa básica encontrar elementos em um conjunto de dados que impliquem a presença de outros elementos na mesma transação, com um grau de certeza definido pelos índices de fator de suporte e o fator de confiança, que pode ser realizado, por exemplo, por meio do algoritmo a priori.
Certo
Errado
Suponha que X tenha distribuição normal com média μ e variância σ2. Considere uma amostra aleatória X1, X2 e X3.
Dos estimadores da média populacional a seguir, assinale o que é viesado.
21X1+21X2.
21X1+21X3.
21X1+41X2+41X3.
21X1+21X2+21X3 .
X2.
Quanto à análise multivariada,
um dos objetivos da análise de componentes principais é o aumento da dimensionalidade dos dados.
na análise discriminante não é necessário conhecer previamente os grupos para obter uma função discriminante a ser usada para alocar os novos elementos.
na regressão logística, uma premissa básica é a ausência de homoscedasticidade nos resíduos.
na análise de conglomerados, uma forma de representar graficamente o processo de agrupamento hierárquico é por meio do dendrograma.
na análise discriminante, não é considerado um pressuposto a ausência de multicolinearidade das variáveis explicativas.
As variáveis aleatórias X e Y são tais que 𝑉𝑎𝑟(𝑋) = 1, 𝑉𝑎𝑟(𝑌) = 4 e 𝐶𝑜𝑣(𝑋, 𝑌) = −1.
O valor de 𝑉𝑎𝑟(𝑌 − 2𝑋) é:
0;
4;
6;
8;
12.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
Existem diversas formas de analisar os resultados de estudos da área de saúde. Em relação a esse tipo de análise, avalie as seguintes informações: o valor da odds ratio (OR) e seu respectivo intervalo de 95% de confiança (IC) para o fator de risco X e sua relação com a ocorrência de câncer de pulmão foi: OR=1,5; IC = (0,95: 2,51) entre os homens e, OR=2,5; IC = (1,5: 4,6) entre as mulheres.
Com base nesses dados, identifique a alternativa correta.
X é fator de risco estatisticamente maior entre as mulheres para desenvolver câncer de pulmão.
X não é fator de risco para desenvolver câncer de pulmão entre os homens.
X é fator de risco para desenvolver câncer de pulmão tanto entre os homens quanto entre as mulheres.
É preciso saber o tamanho da amostra para concluir a análise sobre a OR.
X é fator de proteção para desenvolver câncer de pulmão entre os homens.
Considerando as diversas técnicas de análise multivariada, identifique a alternativa incorreta.
Análise discriminante é uma técnica utilizada para classificação de elementos de uma amostra em caso de grupos que já tenham sido pré-definidos.
Em análise discriminante, para o caso de 2 grupos, uma regra de classificação bastante usada, na prática, é a razão de verossimilhança.
O propósito essencial da análise fatorial é descrever a variabilidade original do vetor de variáveis em termos de um número menor de variáveis chamadas de fatores.
A correlação canônica pode ser vista como uma extensão da regressão múltipla.
Na correlação canônica, só existe uma variável dependente.
Em relação à distribuição Normal, assinale V para a afirmativa verdadeira e F para a falsa.
( ) Se X segue uma distribuição Normal, então a média é igual à mediana e igual à moda.
( ) Quando o tamanho da amostra é grande, a distribuição normal serve como aproximação da distribuição binomial.
( ) Quanto menor a variância, mais achatada é a função densidade de probabilidade da distribuição Normal.
As afirmativas são, respectivamente,
V – V – V
V – V – F.
V – F – V.
F – V – V.
F – V – F.
Com relação à técnica multivariada de componentes principais, avalie as seguintes afirmativas.
1) O método de componentes principais não é invariante a mudanças de escala.
2) A técnica de componentes principais consiste em uma transformação ortogonal dos eixos coordenados do sistema multivariado, buscando as orientações de menor variabilidade.
3) A análise de componentes principais consiste em reescrever as variáveis originais em novas variáveis denominadas componentes principais, através de uma transformação de coordenadas.
4) A análise de componentes principais está relacionada com a explicação da estrutura de covariância por meio de poucas combinações lineares das variáveis originais em estudo.
Estão corretas, apenas:
1, 3 e 4.
1, 2 e 3.
2 e 4.
1 e 4.
2 e 3.
Sobre os métodos de estatística multivariada, é INCORRETO afirmar que:
As técnicas de agrupamento não hierárquicas, como o método das K-médias, necessitam que o número de grupos (clusters) seja predeterminado.
O método de agrupamento hierárquico de Ward busca, dentre os possíveis agrupamentos de dois grupos, unir aqueles que resultem na menor variância global, a qual é minimizada se a distância euclidiana ao quadrado é empregada.
Na análise de componentes principais, supõe-se que as componentes não são correlacionadas entre si. A variância de cada componente principal é igual ao autovalor da matriz de covariâncias associado a ela e cada variável presente no conjunto de dados deve ficar associada a uma única componente principal.
Na análise fatorial, a aplicação de uma rotação ortogonal não altera as comunalidades nem as variâncias específicas, mas pode alterar os percentuais de explicação dos fatores. Além disso, segundo o critério de Kaiser, a escolha do número de fatores é baseada no número de autovalores da matriz de covariância que são maiores ou iguais a 1.