Imagem de fundo

Um cientista de dados está desenvolvendo um modelo de segmentação para classificar proc...

Um cientista de dados está desenvolvendo um modelo de segmentação para classificar procedimentos com base em características quantitativas.

Para garantir a comparabilidade entre variáveis, ele aplicou a padronização por escore z (z-score) em um conjunto de dados multivariados, de modo que todas as variáveis passassem a apresentar média 0 e desvio-padrão 1.

Após a padronização, verificou-se que os dados não apresentavam forte separação entre grupos naturais. Em seguida, foi aplicado o algoritmo K-means em Python:


Imagem associada para resolução da questão


Observou-se que os centroides obtidos apresentam valores próximos de zero em todas as dimensões.


Considerando o contexto descrito, esse resultado ocorre porque


A

o K-means centraliza automaticamente os dados na origem durante a inicialização.


B

os centroides representam as médias dos grupos e, como os dados estão padronizados e não apresentam forte separação, essas médias tendem a permanecer próximas da média global zero.


C

o parâmetro random_state=0 força os centroides a convergirem para a origem.


D

a padronização elimina a variabilidade entre observações, tornando os centroides coincidentes.


E

o número de clusters determina que a soma vetorial dos centroides seja nula.