CommencezCommencez gratuitement

Regroupement K-means : premier exercice

Cet exercice vous familiarisera avec l'utilisation du regroupement K-means sur un ensemble de données. Utilisons l'ensemble de données Comic Con pour voir comment K-means fonctionne.

Rappelez-vous les deux étapes du regroupement K-means :

  • Définir les centres de groupes à l'aide de la fonction kmeans(). Elle a deux arguments obligatoires : les observations et le nombre de groupes.
  • Attribuer les étiquettes de groupes à l'aide de la fonction vq(). Elle a deux arguments obligatoires : les observations et les centres de groupes.

Les données sont stockées dans un DataFrame pandas, comic_con. x_scaled et y_scaled sont les noms de colonnes des coordonnées X et Y normalisées des personnes à un moment donné.

Cette activité fait partie du cours

Analyse de grappes en Python

Voir le cours

Instructions de l’exercice

  • Importez les fonctions kmeans et vq de SciPy.
  • Générez les centres de groupes avec la fonction kmeans() en spécifiant deux groupes.
  • Créez les étiquettes de groupes en utilisant ces centres de groupes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Import the kmeans and vq functions
from ____.cluster.vq import ____, ____

# Generate cluster centers
cluster_centers, distortion = ____

# Assign cluster labels
comic_con['cluster_labels'], distortion_list = ____

# Plot clusters
sns.scatterplot(x='x_scaled', y='y_scaled', 
                hue='cluster_labels', data = comic_con)
plt.show()
Modifier et exécuter le code