開始使用免費開始

以叢集分析探索魚類資料

現在你要用上一題建立的標準化與叢集管線,依魚類的量測值進行分群,接著建立列聯表來比較叢集標籤與實際魚種。

和之前一樣,samples 是魚類量測的 2D 陣列。你的管線為 pipeline,而每個魚類樣本的魚種則由清單 species 提供。

本練習屬於課程

Unsupervised Learning in Python

檢視課程

練習說明

  • 匯入 pandas 並命名為 pd
  • 將管線擬合到魚類量測 samples
  • 使用 pipeline.predict() 方法,為 samples 取得叢集標籤。
  • 使用 pd.DataFrame() 建立一個 DataFrame df,包含兩個欄位,分別命名為 'labels''species',其欄位值分別使用 labelsspecies
  • 使用 pd.crosstab(),以 df['labels']df['species'] 建立列聯表 ct

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import pandas
import pandas as pd

# Fit the pipeline to samples
____

# Calculate the cluster labels: labels
labels = ____

# Create a DataFrame with labels and species as columns: df
df = ____

# Create crosstab: ct
ct = ____

# Display ct
print(ct)
編輯並執行程式碼