

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Considere um conjunto de dados multidimensional, desprovido de rótulos, no qual se observam agrupamentos com densidades distintas, geometrias não convexas e a presença relevante de ruído. Diante desse cenário, um analista compara diferentes técnicas de agrupamento, levando em conta seus pressupostos teóricos, os critérios adotados para formação dos grupos e suas limitações intrínsecas. Diante dessas características, a técnica de agrupamento que melhor modela o cenário descrito é
K-Means, pois é capaz de identificar clusters de formatos arbitrários e tratar naturalmente pontos isolados como ruído, desde que o número de grupos seja bem estimado.
DBSCAN, uma vez que forma agrupamentos a partir da densidade local dos pontos, não exige a definição prévia do número de clusters e permite identificar observações que não pertencem a nenhum grupo.
Gaussian Mixture Models (GMM), o qual atribui cada ponto exclusivamente a um único cluster, com base na menor distância euclidiana ao centroide mais próximo.
KNN, já que realiza clusterização ao estimar distribuições probabilísticas dos dados e ajustar múltiplas componentes gaussianas ao conjunto de observações.
Mean-Shift, o qual determina os agrupamentos, ao deslocar pontos em direção a centroides previamente definidos, sendo particularmente adequado quando o número de clusters é conhecido a priori.
Em um projeto de ciência de dados, pretende-se identificar segmentos de clientes sem rótulos previamente definidos. Após a aplicação de um algoritmo de agrupamento, verificou-se que alguns grupos apresentam formatos elípticos, diferentes densidades e regiões parcialmente sobrepostas. Com base nessas informações, assinale a alternativa correta.
A Análise de Componentes Principais (PCA) constitui um método de agrupamento hierárquico capaz de definir o número de partições a partir da variância explicada.
O Agrupamento Hierárquico produz partições de natureza probabilística, atribuindo a cada observação uma probabilidade de pertencimento a cada grupo.
As Regras de Associação têm como finalidade o particionamento de observações em grupos homogêneos com base em medidas de distância entre os registros.
Os Modelos de Mistura de Gaussianas (GMM) representam os grupos como distribuições probabilísticas, permitindo acomodar diferentes formas, variâncias e sobreposições.
A aplicação do PCA antes do agrupamento preserva as relações não lineares presentes nos dados, mantendo sua estrutura original após a transformação.
Uma Secretaria Estadual analisa contribuintes do ICMS com variáveis numéricas contínuas padronizadas (faturamento, variação intermensal, frequência de retificações e uso de créditos), sem conhecimento prévio do número de grupos, e deseja obter uma estrutura hierárquica interpretável para priorização de auditorias. A combinação técnica que atende ao cenário descrito é
o emprego de k-medoids com distância Manhattan para produzir um dendrograma de risco fiscal.
a utilização de clusterização hierárquica aglomerativa com método de Ward e distância euclidiana ao quadrado.
a aplicação de k-means com distância euclidiana, com definição prévia do número de grupos e segmentação plana dos contribuintes.
a utilização de clusterização hierárquica divisiva com distância do cosseno para variáveis contínuas padronizadas.
a adoção de DBSCAN com métrica de correlação de Pearson para identificar grupos por densidade.
Uma abordagem comum de aprendizado de máquina não supervisionado, empregada em lojas de varejo on-line para entenderem melhor as relações entre diferentes produtos e criarem melhores estratégias de recomendação, é a tarefa denominada
Clustering divisivo.
Testes Captcha.
Algoritmos Apriori.
Regressão linear.
Agrupamento K-means.
Um Professor do IFCE solicita que os alunos analisem dados numéricos coletados por sensores no campus, sem rótulos ou categorias pré-definidas.
O objetivo é identificar automaticamente agrupamentos naturais nos dados, revelando padrões de similaridade sem utilizar informações externas. Para isso, o docente orienta que os estudantes escolham, entre os algoritmos estudados, aquele adequado para realizar clusterização em contexto não supervisionado.
Diante desse contexto, assinale a alternativa que apresenta corretamente o algoritmo que os alunos devem escolher.
SVM (Support Vector Machines).
KNN (K-Nearest Neighbors).
Gradient Boosting.
XGBoost.
Mean Shift.
O objetivo da utilização de modelos supervisionados é o atendimento de tarefas como clusterização, redução de dimensionalidade e detecção de anomalias.
Certo
Errado
Amplamente utilizado em tarefas de clusterização, o algoritmo k-means
ignora valores extremos, uma vez que o cálculo do centroide é baseado em medianas.
tende a produzir clusters esféricos, sendo sensível à escala dos atributos.
encontra agrupamentos independentemente da inicialização e converge para a solução global ótima.
produz como saída, durante sua execução, o valor ótimo de k.
é adequado para dados categóricos, pois calcula centroides usando a moda das categorias.
A alta disponibilidade de bancos de dados pode ser alcançada através de técnicas de clusterização e replicação.
Qual a principal diferença entre clusterização e replicação?
A clusterização envolve múltiplos servidores trabalhando juntos como um único sistema (geralmente com armazenamento compartilhado), enquanto a replicação envolve a cópia de dados de um servidor para outro.
A clusterização é empregada exclusivamente para balanceamento de carga de operações de leitura, enquanto a replicação é utilizada apenas para failover automático, não sendo aplicável a cenários de escalabilidade.
A clusterização exige que todos os servidores estejam obrigatoriamente no mesmo data center físico, ao passo que a replicação permite apenas a comunicação entre ambientes geograficamente distribuídos.
A clusterização constitui uma tecnologia exclusiva de determinados bancos de dados, como o Microsoft SQL Server, enquanto a replicação é restrita a soluções específicas, como o PostgreSQL.
A clusterização não permite a execução de consultas simultâneas em múltiplos nós, enquanto a replicação possibilita esse tipo de execução de forma nativa.
Considere a segmentação de contribuintes por perfil de comportamento fiscal com variáveis numéricas padronizadas e a necessidade de reduzir sensibilidade à inicialização e estabilizar agrupamentos ao longo do tempo. A prática técnica mais adequada ao aplicar K-Means ao cenário descrito é
definir k apenas por julgamento especialista, evitando métricas internas de validação.
trocar a distância para Manhattan, o que impacta positivamente na geometria e na convergência do algoritmo.
usar k-means++ e múltiplas inicializações, selecionando a solução com menor inércia.
fixar centroides por quartis das variáveis originais, garantindo melhor separação dos grupos.
manter os dados padronizados, mas priorizar a magnitude fiscal original na distância (por reponderação), sendo positivo para a formação dos clusters.
A técnica de clustering busca agrupar os dados em categorias predefinidas, descartando os que não se encaixem nessas categorias.
Certo
Errado
Considere as seguintes afirmações sobre clusters:
I. Um cluster aumenta a disponibilidade e tolerância a falhas de sistemas críticos.
II. Clusters podem ser usados para balanceamento de carga e escalabilidade.
III. O Microsoft Failover Cluster é integrado ao Windows Server.
IV. O Oracle RAC (Real Application Clusters) permite múltiplos servidores acessando o mesmo banco de dados simultaneamente.
Assinale a alternativa correta:
Apenas as assertivas III e IV estão corretas.
Apenas as assertivas II e III estão corretas.
As assertivas I, II, III e IV estão corretas.
Apenas as assertivas I e IV estão corretas.
Uma equipe de Ciência de Dados do setor público precisa analisar um grande dataset de características de cidadãos (alta dimensionalidade) para identificar grupos naturais de comportamento (segmentação) e, posteriormente, reduzir a dimensionalidade dos dados sem perder muita informação.
Sobre as técnicas de Clustering e Redução de Dimensionalidade, avalie as afirmativas a seguir.
I. O algoritmo DBSCAN é mais adequado que o K-Means para datasets com clusters de formato não convexo e tem a vantagem de ser robusto a ruídos e outliers.
II. O algoritmo K-Means exige que o número de clusters (K) seja definido previamente e é sensível à escala das variáveis de entrada e à presença de outliers.
III. A Análise de Componentes Principais (PCA) é uma técnica não supervisionada que é utilizada para redução de dimensionalidade, e deve ser aplicada antes de qualquer etapa de scaling dos dados para preservar a variância.
Está correto o que se afirma em
I, apenas.
I e II, apenas.
I e III, apenas.
II e III, apenas.
I, II e III.
A técnica de clustering em data mining atribui categorias aos grupos de dados para facilitar a análise e a tomada de decisão.
Certo
Errado
A análise de clusters é uma técnica multivariada que permite prever a qualidade do ar (boa, moderada ou ruim), com base em variáveis independentes como, por exemplo, os níveis de poluentes e em fatores meteorológicos.
Certo
Errado
Os algoritmos de agrupamento __________ têm como entrada uma matriz de proximidade e produzem, como resultado, uma sequência de partições aninhadas. Existem duas estratégias principais, a aglomerativa, que começa com n clusters com um único objeto e forma a sequência agrupando os cluters sucessivamente, e a divisiva, que começa com um cluster com todos os objetos e forma a sequência dividindo os clusters sucessivamente.
Assinale a alternativa que preenche corretamente a lacuna do trecho acima.
baseados em grid
baseados em grafos
baseados em densidade
hierárquicos
baseados em erro quadrático
Análise discriminante linear é um método de clusterização não supervisionado que agrupa as observações com base na similaridade, sem a necessidade de rótulos de classe.
Certo
Errado
Em arquivo de registros ordenado sequencialmente, a chave de busca do índice de agrupamento (clustering index) também define a ordem sequencial do arquivo.
Certo
Errado
O tipo de Cluster que desmembra uma tarefa bastante complexa em pequenas tarefas mais simples, distribuindo-as para os nós que estão interligados na rede, é o Cluster de
processamento paralelo.
balanceamento de carga.
alta disponibilidade.
alto desempenho.
No Linux, ao se executar o comando dpkg, todas as dependências do pacote solicitado são instaladas, sem a necessidade de confirmação do administrador.
Certo
Errado
Algoritmos de agrupamento são fundamentais para a área de aprendizado de máquina não supervisionado. Em geral, esses algoritmos determinam clusters de instâncias de dados que possuem algum traço de similaridade entre si. Relacione os métodos de agrupamento hierárquico e o K-means às suas principais características.
1. Agrupamento Hierárquico
2. K-means
( ) Seus resultados são altamente sensíveis ao número de clusters que deve ser pré-definido pelo usuário do algoritmo.
( ) Baseia-se em abordagens top-down ou bottom-up, isto é, com a divisão ou com a união sucessiva de clusters.
( ) Seus resultados costumam ser graficamente visualizados por dendrogramas, que podem ser seccionados de acordo com o número de clusters determinado pelo usuário do algoritmo.
( ) Avalia distâncias entre as instâncias de dados e os centroides dos clusters e atualiza a posição dos centroides dos clusters sucessivamente, até a convergência.
Assinale a opção que indica a relação correta, na ordem apresentada.
2 – 1 – 2 – 1.
2 – 2 – 2 – 1.
2 – 1 – 2 – 2.
2 – 1 – 1 – 2.
1 – 1 – 2 – 2.