Imagem de fundo

Considere um conjunto de dados multidimensional, desprovido...

Considere um conjunto de dados multidimensional, desprovido de rótulos, no qual se observam agrupamentos com densidades distintas, geometrias não convexas e a presença relevante de ruído. Diante desse cenário, um analista compara diferentes técnicas de agrupamento, levando em conta seus pressupostos teóricos, os critérios adotados para formação dos grupos e suas limitações intrínsecas. Diante dessas características, a técnica de agrupamento que melhor modela o cenário descrito é


A

K-Means, pois é capaz de identificar clusters de formatos arbitrários e tratar naturalmente pontos isolados como ruído, desde que o número de grupos seja bem estimado.


B

DBSCAN, uma vez que forma agrupamentos a partir da densidade local dos pontos, não exige a definição prévia do número de clusters e permite identificar observações que não pertencem a nenhum grupo.


C

Gaussian Mixture Models (GMM), o qual atribui cada ponto exclusivamente a um único cluster, com base na menor distância euclidiana ao centroide mais próximo.


D

KNN, já que realiza clusterização ao estimar distribuições probabilísticas dos dados e ajustar múltiplas componentes gaussianas ao conjunto de observações.


E

Mean-Shift, o qual determina os agrupamentos, ao deslocar pontos em direção a centroides previamente definidos, sendo particularmente adequado quando o número de clusters é conhecido a priori.