Vyhodnocení clusterování zrní
V předchozím cvičení jsi z grafu inercie zjistil/a, že pro data o zrní je vhodný počet clusterů 3. Vzorky zrní totiž pocházejí ze tří různých odrůd: „Kama“, „Rosa“ a „Canadian“. V tomto cvičení rozdělíš vzorky zrní do tří clusterů a pomocí křížové tabulky porovnáš clustery s odrůdami.
Máš k dispozici pole samples se vzorky zrní a seznam varieties s odrůdou pro každý vzorek. Pandas (pd) a KMeans jsou již naimportovány.
Toto cvičení je součástí kurzu
Unsupervised Learning in Python
Pokyny k cvičení
- Vytvoř model
KMeanss názvemmodelse3clustery. - Pomocí metody
.fit_predict()modelumodelho natrénuj nasamplesa získej štítky clusterů. Použití.fit_predict()je ekvivalentní volání.fit()následovaného.predict(). - Vytvoř DataFrame
dfse dvěma sloupci pojmenovanými'labels'a'varieties', které naplníš hodnotami zlabelsavarieties. Tento krok je již hotový. - Pomocí funkce
pd.crosstab()nadf['labels']adf['varieties']spočítej, kolikrát se každá odrůda zrní shoduje s jednotlivými štítky clusterů. Výsledek ulož doct. - Klikni na Odeslat a prohlédni si křížovou tabulku!
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a KMeans model with 3 clusters: model
model = ____
# Use fit_predict to fit model and obtain cluster labels: labels
labels = ____
# Create a DataFrame with labels and varieties as columns: df
df = pd.DataFrame({'labels': labels, 'varieties': varieties})
# Create crosstab: ct
ct = ____
# Display ct
print(ct)