以叢集分析探索魚類資料
現在你要用上一題建立的標準化與叢集管線,依魚類的量測值進行分群,接著建立列聯表來比較叢集標籤與實際魚種。
和之前一樣,samples 是魚類量測的 2D 陣列。你的管線為 pipeline,而每個魚類樣本的魚種則由清單 species 提供。
本練習屬於課程
Unsupervised Learning in Python
練習說明
- 匯入
pandas並命名為pd。 - 將管線擬合到魚類量測
samples。 - 使用
pipeline的.predict()方法,為samples取得叢集標籤。 - 使用
pd.DataFrame()建立一個 DataFramedf,包含兩個欄位,分別命名為'labels'與'species',其欄位值分別使用labels與species。 - 使用
pd.crosstab(),以df['labels']與df['species']建立列聯表ct。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import pandas
import pandas as pd
# Fit the pipeline to samples
____
# Calculate the cluster labels: labels
labels = ____
# Create a DataFrame with labels and species as columns: df
df = ____
# Create crosstab: ct
ct = ____
# Display ct
print(ct)