Regroupement K-means : premier exercice
Cet exercice vous familiarisera avec l'utilisation du regroupement K-means sur un ensemble de données. Utilisons l'ensemble de données Comic Con pour voir comment K-means fonctionne.
Rappelez-vous les deux étapes du regroupement K-means :
- Définir les centres de groupes à l'aide de la fonction
kmeans(). Elle a deux arguments obligatoires : les observations et le nombre de groupes. - Attribuer les étiquettes de groupes à l'aide de la fonction
vq(). Elle a deux arguments obligatoires : les observations et les centres de groupes.
Les données sont stockées dans un DataFrame pandas, comic_con. x_scaled et y_scaled sont les noms de colonnes des coordonnées X et Y normalisées des personnes à un moment donné.
Cette activité fait partie du cours
Analyse de grappes en Python
Instructions de l’exercice
- Importez les fonctions
kmeansetvqde SciPy. - Générez les centres de groupes avec la fonction
kmeans()en spécifiant deux groupes. - Créez les étiquettes de groupes en utilisant ces centres de groupes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____
# Generate cluster centers
cluster_centers, distortion = ____
# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____
# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled',
hue='cluster_labels', data = comic_con)
plt.show()