Évaluer le regroupement des grains
Dans l'exercice précédent, vous avez vu sur le graphique de l'inertie que 3 est un bon nombre de clusters pour les données de grains. En fait, les échantillons de grains proviennent d'un mélange de 3 variétés différentes : « Kama », « Rosa » et « Canadian ». Dans cet exercice, regroupez les échantillons de grains en trois clusters et comparez ces clusters aux variétés de grains à l'aide d'un tableau croisé.
Vous disposez du tableau samples contenant les échantillons de grains et d'une liste varieties indiquant la variété de chaque échantillon. Pandas (pd) et KMeans ont déjà été importés pour vous.
Cette activité fait partie du cours
Unsupervised Learning in Python
Instructions de l’exercice
- Créez un modèle
KMeansappelémodelavec3clusters. - Utilisez la méthode
.fit_predict()demodelpour l'entraîner sursampleset obtenir les étiquettes de cluster. Utiliser.fit_predict()revient à utiliser.fit()puis.predict(). - Créez un DataFrame
dfavec deux colonnes nommées'labels'et'varieties', en utilisant respectivementlabelsetvarietiescomme valeurs de colonnes. Cela a été fait pour vous. - Utilisez la fonction
pd.crosstab()surdf['labels']etdf['varieties']pour compter le nombre de fois où chaque variété de grain coïncide avec chaque étiquette de cluster. Assignez le résultat àct. - Appuyez sur Soumettre pour voir le tableau croisé !
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a KMeans model with 3 clusters: model
model = ____
# Use fit_predict to fit model and obtain cluster labels: labels
labels = ____
# Create a DataFrame with labels and varieties as columns: df
df = pd.DataFrame({'labels': labels, 'varieties': varieties})
# Create crosstab: ct
ct = ____
# Display ct
print(ct)