Klustra fiskdata
Nu ska du använda din standardiserings- och klustrings-pipeline från föregående övning för att klustra fiskarna utifrån deras mätningar och sedan skapa en korstabell för att jämföra klusteretiketterna med fiskarternas namn.
Precis som tidigare är samples en tvådimensionell array med fiskmätningar. Din pipeline finns tillgänglig som pipeline, och arten för varje fiskprov anges av listan species.
Den här övningen är en del av kursen
Oövervakad inlärning i Python
Övningsinstruktioner
- Importera
pandassompd. - Anpassa pipelinen till fiskmätningarna
samples. - Hämta klusteretiketterna för
samplesmed.predict()-metoden påpipeline. - Skapa en DataFrame
dfmedpd.DataFrame()som innehåller två kolumner med namnen'labels'och'species', där du använderlabelsrespektivespeciessom kolumnvärden. - Skapa en korstabell
ctavdf['labels']ochdf['species']med hjälp avpd.crosstab().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import pandas
import pandas as pd
# Fit the pipeline to samples
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame with labels and species as columns: df
df = ____
# Create crosstab: ct
ct = ____
# Display ct
print(ct)