Questões de Concurso sobre Agrupamento (Clustering)

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
61 questões encontradas
Questões por página
20
Mais recentes
 

No âmbito do aprendizado de máquina não supervisionado, os algoritmos de agrupamento (clustering) apresentam diferentes abordagens para a organização de dados sem rótulos. Considerando as propriedades operacionais dos algoritmos k-means, DBSCAN e SOM (self-organizing maps), assinale a opção correta.


A

O DBSCAN e o SOM operam sob a mesma função de custo baseada na minimização da soma dos erros quadráticos (SSE) em relação a um ponto central fixo.


B

O k-means é um algoritmo de particionamento que minimiza a variância intracluster, sendo inerentemente robusto quanto à presença de outliers devido ao uso da média aritmética para o cálculo dos centroides.


C

O DBSCAN fundamenta-se na densidade local de pontos, permitindo a identificação de agrupamentos de formas geométricas arbitrárias e a segregação de ruído, prescindindo da especificação prévia do número de clusters.


D

O SOM utiliza uma arquitetura de rede neural competitiva para realizar a redução de dimensionalidade e o agrupamento, garantindo a preservação da topologia global sem a necessidade de definir uma vizinhança entre os neurônios.


E

O k-means apresenta desempenho superior ao DBSCAN na detecção de agrupamentos não convexos ou com densidades significativamente distintas.

Em uma secretaria de fazenda, analistas de dados buscam identificar perfis de contribuintes com padrões semelhantes de comportamento tributário, de modo a orientar auditorias fiscais preventivas. Nesse contexto, a escolha do método analítico deve considerar a ausência de rótulos previamente definidos e o grande volume de atributos numéricos e categóricos associados às declarações.


A partir da situação anterior, assinale a opção em que é corretamente descrita a técnica mais adequada para a finalidade pretendida pelos analistas de dados em questão.


A

A análise de correlação é a técnica mais apropriada para detectar grupos de contribuintes com comportamentos fiscais similares, pois avalia a dependência estatística entre múltiplas variáveis simultaneamente.


B

As árvores de decisão são técnicas não supervisionadas de agrupamento hierárquico, ideais para identificar automaticamente padrões ocultos entre variáveis fiscais heterogêneas.


C

A análise discriminante é adequada para o agrupamento de contribuintes sem rótulos prévios, pois utiliza métricas de distância para maximizar a separação entre grupos formados aleatoriamente.


D

A regressão logística, por ser um método supervisionado, permite agrupar contribuintes com base em características comuns, estimando probabilidades de pertencimento a grupos previamente não definidos.


E

O algoritmo k-means é apropriado para segmentar contribuintes em grupos com padrões semelhantes, desde que as variáveis categóricas sejam previamente transformadas em representações numéricas adequadas.

Uma Fundação Pública foi incumbida de analisar dados socioeconômicos de municípios, considerando variáveis como renda per capita, índice de escolaridade e acesso a saneamento básico. O objetivo é identificar grupos de municípios com características semelhantes, sem a existência de categorias previamente definidas, permitindo a segmentação para políticas públicas mais específicas. Considerando os tipos de algoritmos de aprendizado de máquina, assinale a alternativa que apresenta um algoritmo adequado para realizar essa tarefa.


A

Regressão Logística.


B

DBSCAN (Density-Based Spatial Clustering of Applications with Noise).


C

Árvore de Decisão.


D

Naive Bayes.

Janaina, uma analista da ALEGO, desenvolveu o programa Python (versão 3) que utiliza as bibliotecas numpy (2.0.2) e scikit-learn (versão 1.6.1) para realizar uma análise de agrupamentos. Analise o código a seguir.


from sklearn.cluster import KMeans

import numpy as np

X = np.array([[1, 2], [1, 4], [1, 0],

[10, 2], [10, 4], [10, 0]])

kmeans = KMeans(n_clusters=2, random_state=0, n_init="auto").fit(X)

kmeans.labels_

kmeans.predict([[1, 1], [14, 4]]) kmeans.cluster_centers_


O resultado impresso é igual a


A

array([[1., 2.],

[ 10., 2.]])


B

array([[1., 4.],

[ 10., 4.]])


C

array([[1., 3.],

[ 9., 4.]])


D

array([[10., 4.],

[ 1., 4.]])


E

array([[10., 2.],

[ 1., 2.]])

Para processar terabytes de logs de notas fiscais eletrônicas, o TCE-SC utiliza um cluster Apache Spark. O Auditor nota que o processamento está lento devido ao excesso de movimentação de dados entre os nós da rede durante operações de agrupamento.


A operação do Spark conhecida por causar esse fenômeno de Shuffle e que deve ser utilizada com cautela em grandes datasets é:


A

map()


B

filter()


C

groupByKey()


D

broadcast()


E

first()

Uma Secretaria da Fazenda Estadual precisa analisar 500 mil declarações fiscais para identificar contribuintes com comportamento tributário similar, sem ter exemplos prévios de classificação. A equipe técnica deve agrupar as empresas considerando apenas as características declaradas (receita, despesas, setor, localização) e descobrir padrões naturais nos dados.


A técnica mais adequada para essa tarefa é:


A

Árvores de decisão, pois criam regras hierárquicas de classificação baseadas em variáveis fiscais usando exemplos rotulados de empresas regulares e irregulares.


B

Análise de séries temporais, pois identifica tendências e padrões sazonais na arrecadação tributária ao longo do tempo para projeções futuras de receita.


C

Regressão logística, pois classifica empresas em categorias de risco fiscal utilizando variáveis preditoras numéricas e categóricas com base em histórico de autuações anteriores.


D

K-means clustering, pois agrupa empresas por similaridade sem necessidade de rótulos prévios, identificando padrões naturais nos dados declarados pelos contribuintes.


E

Redes neurais profundas, pois aprendem representações complexas dos dados fiscais através de múltiplas camadas ocultas treinadas com backpropagation supervisionado.

Algoritmos não supervisionados identificam agrupamentos ou estruturas ocultas nos dados sem a necessidade de rótulos prévios, operando exclusivamente sobre as observações.


C

Certo


E

Errado

Mineração de dados compreende um conjunto de técnicas usadas para identificar padrões, correlações, tendências e outras informações valiosas em grandes volumes de dados. Técnicas (métodos) de mineração de dados envolvem diferentes tipos de algoritmos para realizar tarefas sobre os dados, tais como classificação, análise de regressão e agrupamento (clustering). Qual característica é associada a algoritmos relacionados à análise de regressão no contexto de mineração de dados?


A

Algoritmos de regressão estimam relações matemáticas contínuas entre variáveis, podendo modelar tendências e prever valores numéricos.


B

Algoritmos de regressão identificam semelhanças em instâncias de dados numéricos, criando classes similares e atribuindo rótulos aos dados.


C

Algoritmos de regressão analisam dados passados, identificando padrões numéricos e criando hipóteses para explicar a evolução dos dados.


D

Algoritmos de regressão transformam conjuntos de dados em pontos de um espaço de decisão, identificando correlações numéricas entre esses pontos.

O k-means é um algoritmo iterativo de agrupamento baseado em centroides, isto é, ele divide um conjunto de dados em grupos semelhantes com base na distância entre seus centroides.


C

Certo


E

Errado

O algoritmo K-means garante a otimização dos clusters, independentemente da inicialização dos centroides, desde que a métrica de distância utilizada seja euclidiana, e os dados estejam em um espaço vetorial de baixa dimensionalidade.


C

Certo


E

Errado

A estagiária Mirella sabe que scikitlearn versão 1.6.1 oferece diversos algoritmos de aprendizado não supervisionado. No entanto, ela desconhece quais são os métodos de clusterização disponíveis no módulo sklearn.cluster.


Assinale a opção que contém apenas os nomes dos métodos de clusterização disponíveis no módulo.


A

Hdbscan e regressão logística.


B

Mean-shift e naive bayes.


C

Perceptron e optics.


D

Birch e k-means.


E

Dbscan e lasso.

O algoritmo de agrupamento K-means — baseado em centroides, que divide um conjunto de dados em grupos semelhantes com base na distância entre seus centroides — pode ser utilizado para, a partir de uma base de dados de uma rede social, identificar comunidades de usuários com interesses comuns em determinados assuntos.


C

Certo


E

Errado

O Aprendizado de Máquina (Machine Learning - ML) é uma subárea da Inteligência Artificial (IA) que capacita os sistemas a “aprenderem” a partir de dados, ou seja, a ajustarem seu comportamento com base em padrões identificados nos dados, sem a necessidade de programação explicita para cada tarefa. Em vez de serem programados para realizar tarefas específicas, os algoritmos de aprendizado de máquina analisam dados, detectam padrões e fazem previsões ou tomam decisões baseadas nesse aprendizado. Considerando isso, assinale a alternativa que apresenta a técnica de aprendizado de máquina que agrupa dados de maneira que os itens dentro de um grupo sejam mais semelhantes entre si e diferentes de outros grupos. Exemplo: segmentação de clientes com base em seu comportamento.


A

Redução de dimensionalidade.


B

Classificação.


C

Regressão.


D

Associação.


E

Clusterização.

Sobre algoritmos de mineração de dados, avalie as afirmativas a seguir e assinale (V) para a verdadeira e (F) para a falsa.


( ) K-means, também conhecido como K-NN, é um algoritmo baseado na ideia de que objetos semelhantes estão próximos uns dos outros.

( ) Árvore de decisão é uma estrutura hierárquica constituída por nós. Nela, o coeficiente de Gini de um nó é sempre maior do que o do seu nó pai.

( ) O algoritmo SVM, utilizado apenas para a tarefa de classificação, emprega classificadores lineares que separam o conjunto de dados por meio de hiperplanos, não sendo possível seu uso com problemas não linearmente separáveis.


As afirmativas são, respectivamente,


A

V – V – F.


B

F – V – V.


C

F – F – V.


D

V – F – F.


E

F – F – F.

Ano: 2025
Prova: CESPE/CEBRASPE - SUSEP - Analista Técnico - Área: Tecnologia da Informação e Ciencia de Dados - 2025

No agrupamento hierárquico, ao contrário do k-means, não se exige especificação prévia do número de clusters.


C

Certo


E

Errado

Nos algoritmos aglomerativos, ocorre primeiramente a classificação de cada objeto em um grupo e, então, combinam-se os grupos com base em suas proximidades, processo repetido até que exista um cluster, que inclua todos os objetos; já nos algoritmos divisivos, todos os pontos são inicialmente considerados como grupo único, subdividido sucessivamente até que alguma regra de parada seja satisfeita.


C

Certo


E

Errado

Assinale a opção em que é corretamente apresentada uma limitação do particionamento final produzido pelo algoritmo k-means.


A

inaplicabilidade para grupos com formato aproximadamente esférico e de tamanhos variados


B

exigência de que os dados de entrada estejam previamente rotulados


C

imutabilidade do resultado final, independentemente da inicialização dos centroides


D

não utilização de medidas de distância, como a euclidiana, para o cálculo da similaridade entre pontos e centroides


E

necessidade de que o número de grupos (k) seja definido antes da execução do algoritmo

O IFMS está realizando uma análise de dados para melhorar a experiência de aprendizado dos alunos no curso de Desenvolvimento Web. O objetivo da análise é identificar diferentes grupos de alunos com base no comportamento de interação com o conteúdo do curso e no desempenho nas avaliações. Essa segmentação visa personalizar as abordagens de ensino, como estratégias de recuperação de aprendizado e adaptação de conteúdo. A equipe de TI (Tecnologia da Informação), composta pelo analista de informática do IFMS, utiliza técnicas de mineração de dados para encontrar padrões e agrupamentos nos dados dos alunos. Nesse sentido, o analista precisa escolher um algoritmo de clusterização para agrupar os alunos em segmentos, levando em consideração variáveis como tempo de acesso, desempenho em atividades, participação em fóruns e engajamento com o material didático. Diante das seguintes opções, assinale a alternativa que apresenta corretamente um algoritmo de clusterização que pode ser utilizado para agrupar os alunos de acordo com as variáveis analisadas.


A

DBSCAN (Density-Based Spatial Clustering of Applications with Noise).


B

Naive Bayes.


C

Eclat.


D

Apriori.


E

FP-Growth (Frequent Pattern Growth).

Aprendizado não supervisionado usa algoritmos para analisar e agrupar conjuntos de dados não rotulados. Esses algoritmos descobrem padrões ocultos ou agrupamentos de dados sem a necessidade de intervenção humana.


Selecione a opção que contém somente métodos de aprendizado não supervisionado.


A

DBSCAN e K-Means


B

ChatGPT e Regressão Linear.


C

Naive-Bayes e Regressão Matricial.


D

Regressão Logística e Random Forest.


E

Probabilistic Forest e Máquina de Vetor de Suporte.

 
 
Gerar simulado