

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
A clusterização é uma técnica supervisionada de mineração de dados, pois depende de rótulos previamente definidos para agrupar os registros em clusters homogêneos, funcionando de forma similar à classificação.
Certo
Errado
Em análise de dados, diferentes métodos podem ser classificados como supervisionados ou não supervisionados, dependendo do uso de rótulos (labels).
Assinale a alternativa CORRETA:
Regressão linear e K-means são ambos métodos não supervisionados.
Classificação logística é um método não supervisionado, pois não utiliza rótulos.
K-means e agrupamento hierárquico são métodos não supervisionados, pois buscam identificar padrões sem rótulos prévios.
Árvores de decisão e K-means são ambos métodos supervisionados.
Métodos supervisionados não utilizam dados históricos.
O k-means é um método de agrupamento simples. Apesar de apresentar limitações importantes, de modo geral, um ponto forte deste método é ser:
Computacionalmente eficiente.
Robusto à inicialização dos centroides.
Independe da definição prévia do número de grupos.
Funcionar bem quando os grupos têm formatos não esféricos.
Dentre as técnicas de Machine Learning, constitui um exemplo de aprendizado não supervisionado
k-NN.
SVM com kernel linear.
k-means.
Random Forest
Regressão logística.
A Análise de Agrupamento (ou Cluster Analysis) é uma técnica exploratória utilizada para identificar grupos de observações ou variáveis que sejam homogêneos internamente e heterogêneos entre si. Sobre os métodos e conceitos dessa técnica, analise as afirmativas a seguir:
I.Os métodos de agrupamento hierárquico, como o de Ward ou o da ligação completa (complete linkage), não exigem a pré-especificação do número de clusters e o resultado é tipicamente visualizado em um dendrograma, que mostra a sequência de fusões ou divisões dos grupos.
II.O método não hierárquico K-médias (K-means) é ideal para dados que contêm variáveis categóricas e outliers, pois o algoritmo é robusto a esses fatores e utiliza a distância de Manhattan como padrão.
III.No método de agrupamento hierárquico de ligação simples (single linkage), a distância entre dois clusters é definida pela distância entre os dois pontos mais distantes de cada cluster, o que tende a formar grupos esféricos e compactos.
Está correto o que se afirma em:
I, II e III.
I e III apenas.
I apenas.
II apenas.
III apenas.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
O algoritmo k-means é um método de clusterização do tipo particional que requer a definição prévia do número de clusters e utiliza a média dos elementos como critério para a atualização dos centroides.
Certo
Errado
No campo da análise multivariada, existem diferentes técnicas estatísticas, cada uma com finalidades específicas, como redução de dimensionalidade, identificação de variáveis latentes ou agrupamento de casos semelhantes. Com base nesse contexto, assinale a alternativa abaixo que corresponde à Análise de Agrupamentos (Cluster Analysis).
É uma transformação que gera, a partir de um grupo de p variáveis, outro grupo de p variáveis não correlacionadas entre si.
Tem como objetivo descrever a estrutura de dependência de um grupo de variáveis por meio da identificação de variáveis latentes (não observáveis), que resumem aspectos comuns das variáveis originais.
É um conjunto de técnicas utilizadas na identificação de padrões de resposta por meio da formação de grupos homogêneos de casos ou, eventualmente, de variáveis.
É uma técnica estatística multivariada que, a partir da estrutura de dependência existente entre um grupo de variáveis, permite a criação de um grupo menor de variáveis, que resumem parte da informação contida no conjunto original dos dados.
É aplicada para gerar variáveis não correlacionadas que explicam progressivamente a variabilidade dos dados originais.
8 Na análise de agrupamento hierárquico pelo método de Ward, os grupos são formados com base na maximização da variância intragrupo.
Certo
Errado
Em um estudo com diversos indicadores socioeconômicos de diferentes bairros de uma cidade, um estatístico deseja identificar grupos de bairros com características semelhantes, considerando simultaneamente todas as variáveis observadas (renda média, taxa de desemprego, escolaridade, entre outras). Nesse caso, o método multivariado mais apropriado para atingir esse objetivo é
regressão linear múltipla.
Análise de Componentes Principais (ACP).
Análise de Agrupamentos (Cluster Analysis).
Análise de variância (ANOVA).
regressão linear simples.
Um servidor público de um órgão previdenciário, após analisar um conjunto de dados sobre benefícios concedidos, percebeu uma ampla variação nos valores e nas características dos beneficiários. Para organizar melhor essas informações, ele precisa agrupar os beneficiários conforme seus perfis, permitindo uma análise mais precisa e a implementação de políticas específicas para cada grupo.
Assinale a opção que contém o algoritmo mais apropriado para realizar a tarefa acima.
Dijkstra.
PCA.
LSTM.
K-means.
ARIMA.


Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Uma equipe do Ministério Alfa conduz um projeto baseado em Big Data para entender o perfil de acesso da população a atividades financiadas com recursos federais. A base integra milhões de registros oriundos de plataformas digitais de ingressos, editais culturais, visitas a museus federais e interações nas redes sociais de equipamentos culturais.
Como a pesquisa ainda não tem uma variável-alvo definida, o objetivo inicial é identificar grupos latentes de usuários com padrões semelhantes de comportamento, considerando variáveis como frequência de participação, região e faixa etária. Após essa etapa, a equipe pretende avaliar os fatores que contribuem para o engajamento cultural em regiões com baixa participação e, por fim, recomendar estratégias de ampliação de acesso.
Considerando os modelos multivariados, a natureza da base de dados e os objetivos e etapas propostos para a pesquisa, a equipe responsável deveria:
começar com análise de séries temporais desagregadas por faixa etária e, a partir delas, gerar agrupamentos por similaridade de comportamento;
aplicar análise prescritiva com base em redes neurais profundas desde o início, pois a ausência de variável-alvo impede o uso de aprendizado supervisionado;
iniciar com clusterização por k-médias, caracterizar os grupos com análise descritiva e, então, empregar regressão preditiva para estimar o impacto de intervenções;
utilizar agrupamento hierárquico para redução de dimensionalidade, seguido de técnicas de análise discriminante para prever padrões de engajamento futuro;
aplicar regressão logística sobre variáveis de participação por região e perfil, seguida de análise de variância, para testar diferenças estatísticas significativas entre os grupos.
Considere a tabela abaixo que mostra as distâncias entre cada observação de um conjunto de dados hipotético e os vetores médios (centroides) do cluster correspondente ao final da aplicação do algoritmo de agrupamento k-means. Com base nessa tabela, infere-se que o cluster 1 é constituído pelas observações 2, 5 e 10.
cluster | ||||
Observação | 1 | 2 | 3 | 4 |
1 | 3 | 8 | 7 | 12 |
2 | 12 | 7 | 5 | 10 |
3 | 7 | 3 | 8 | 10 |
4 | 4 | 8 | 12 | 8 |
5 | 12 | 5 | 7 | 7 |
6 | 2 | 7 | 6 | 10 |
7 | 7 | 12 | 9 | 1 |
8 | 8 | 10 | 4 | 9 |
9 | 5 | 2 | 6 | 6 |
10 | 9 | 8 | 5 | 2 |
Certo
Errado
O gestor de uma grande sociedade empresária, para definir metas e indicadores de desempenho, cria uma base de dados com os resultados da última avaliação realizada com os funcionários. Essa avaliação formou uma base que pretende ser utilizada para tomada de decisões como promoções, aumentos salariais, transferências e até demissões.
Cada funcionário foi avaliado segundo os critérios de pontualidade, assiduidade, motivação, satisfação no trabalho e cumprimento das tarefas designadas, recebendo uma nota de 0 a 10 pontos para cada critério. Para simplificar a análise, agruparam-se os funcionários por similaridade de acordo com os critérios mencionados.
A técnica de análise multivariada mais adequada para criar os grupos e analisar o desempenho dos funcionários é:
Análise de componentes principais;
Análise fatorial;
Análise discriminante;
Análise de cluster;
Análise de correspondência.
A ação de realizar agrupamento hierárquico tem como premissa básica encontrar elementos em um conjunto de dados que impliquem a presença de outros elementos na mesma transação, com um grau de certeza definido pelos índices de fator de suporte e o fator de confiança, que pode ser realizado, por exemplo, por meio do algoritmo a priori.
Certo
Errado
Sobre as técnicas da análise multivariada de dados, considere as seguintes afirmações.
I - A análise fatorial é um exemplo de técnica de interdependência.
II - Na análise discriminante, a variável dependente deve ser categórica.
III - Na análise de cluster, as técnicas não hierárquicas exigem que o usuário identifique previamente o número de grupos desejado, o que não acontece nas técnicas hierárquicas.
IV - A análise de correspondência é adequada para estudar a relação entre variáveis quantitativas.
Quais estão corretas?
Apenas I e II.
Apenas I e III.
Apenas III e IV.
Apenas I, II e III.
Apenas II e IV.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
Um dos problemas mais comuns para o emprego de análise multivariada é o problema de agrupamento - 'clustering' de dados estruturados a partir de uma métrica. Considere os pontos descritos pelo par de variáveis aleatórias (x, y) usadas para classificar um determinado grupo de objetos.

Os agrupamentos são testados utilizando-se a métrica (M),
M = [(4-n)] (2n-1)]2 ∑j=1n Dj
onde n é o número de agrupamentos e Dj é uma medida de dispersão do j-ésimo grupo em relação ao centróide (xcj, ycj) de cada grupo.
Considera-se a melhor combinação de agrupamentos aquela que tem o maior valor para a métrica.
Foram escolhidas duas formas agrupar esses pontos: (A) com dois agrupamentos (n=2); e (B) com três agrupamentos (n=3). A tabela abaixo apresenta os agrupamentos escolhidos e os valores aproximados para a dispersão Dj em cada caso.
n = 2
| n = 3
|
D1 = 3,2 D2 = 2,7 | D1 = 0,5 D2 = 2,7 D3 = 2,7 |
Assinale a alternativa que apresenta a melhor forma de agrupamento dentro dessa métrica e o valor aproximado para a métrica.
Agrupamento (A) com aproximadamente M = 212
Agrupamento (A) com aproximadamente M = 616
Agrupamento (B) com aproximadamente M = 212
Agrupamento (B) com aproximadamente M = 616
Sobre dados multivariados, analise as afirmativas a seguir, empregando (V) para as verdadeiras e (F) para as falsas.
( ) O fato de demonstrar que todas as distribuições univariadas e bivariadas são normais não implica que o vetor tenha distribuição normal multivariada. Na prática, porém, quando isso ocorre, a chance de se estar com um vetor normal multivariado é muito grande.
( ) Uma forma de auxiliar na verificação de normalidade multivariada é utilizar uma medida de distância, baseada na distribuição de probabilidade qui-quadrado, que, por sua vez, utiliza o vetor de médias e a matriz de covariância amostral.
( ) Na análise de componentes principais, o objetivo é explicar a estrutura de variância e covariância de um vetor aleatório, construindo, a partir das variáveis originais, combinações lineares que sejam ao máximo correlacionadas entre si.
( ) Na análise de agrupamentos, que visa encontrar uma partição de n elementos em k grupos, os métodos hierárquicos e não hierárquicos diferem em alguns aspectos. No entanto, assemelham-se quanto à não necessidade de o usuário especificar previamente o número de clusters desejado.
A sequência CORRETA de afirmativas verdadeiras (V) e falsas (F), de cima para baixo, é:
V, V, F, V.
V, V, V, F.
F, V, F, F.
V, F, F, F.
V, V, F, F.
Em um tipo de amostra probabilística, a população é dividida em grupos que se excluem mutuamente e o entrevistador extrai uma amostra dos grupos para entrevistar. Trata-se da amostra:
por cota
por cluster
aleatória simples
aleatória estratificada
Análise de agrupamento, ou clustering, é um grupo de técnicas multivariadas cujo propósito consiste em separar unidades em grupos, de acordo com diversas variáveis. A ideia básica é colocar em um mesmo grupo unidades similares de acordo com um critério especificado. Em relação a esse tipo de técnica de análise multivariada, avalie as afirmações abaixo.
I O conceito de similaridade é fundamental, e as medidas de similaridade em geral envolvem associação e distância.
II A suposição de normalidade dos dados é fundamental.
III Para aplicação de análise de agrupamento, as variáveis precisam ser quantitativas.
IV Para aplicar o método das k-médias, é necessário decidir preliminarmente em quantos grupos o conjunto de unidades será dividido.
Em relação às técnicas de análise de agrupamento, estão corretas as afirmativas