

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Um cientista de dados está desenvolvendo um modelo de segmentação para classificar procedimentos com base em características quantitativas.
Para garantir a comparabilidade entre variáveis, ele aplicou a padronização por escore z (z-score) em um conjunto de dados multivariados, de modo que todas as variáveis passassem a apresentar média 0 e desvio-padrão 1.
Após a padronização, verificou-se que os dados não apresentavam forte separação entre grupos naturais. Em seguida, foi aplicado o algoritmo K-means em Python:

Observou-se que os centroides obtidos apresentam valores próximos de zero em todas as dimensões.
Considerando o contexto descrito, esse resultado ocorre porque
o K-means centraliza automaticamente os dados na origem durante a inicialização.
os centroides representam as médias dos grupos e, como os dados estão padronizados e não apresentam forte separação, essas médias tendem a permanecer próximas da média global zero.
o parâmetro random_state=0 força os centroides a convergirem para a origem.
a padronização elimina a variabilidade entre observações, tornando os centroides coincidentes.
o número de clusters determina que a soma vetorial dos centroides seja nula.