開始使用免費開始

訓練你的第一棵分類樹

在這個練習中,你會使用來自 UCI 機器學習資料庫的 Wisconsin Breast Cancer Dataset。你要根據兩個特徵來預測腫瘤是惡性還是良性:腫瘤的平均半徑(radius_mean)以及其平均凹點數量(concave points_mean)。

資料集已經載入你的工作環境,並分為 80% 訓練集與 20% 測試集。特徵矩陣分別指派給 X_trainX_test,而標籤陣列分別指派給 y_trainy_test,其中類別 1 代表惡性腫瘤,類別 0 代表良性腫瘤。為了讓結果可重現,我們也定義了一個名為 SEED 的變數並將其設為 1。

本練習屬於課程

Machine Learning with Tree-Based Models in Python

檢視課程

練習說明

  • sklearn.tree 匯入 DecisionTreeClassifier

  • 以最大深度為 6 建立一個 DecisionTreeClassifier,命名為 dt

  • dt 擬合到訓練集。

  • 預測測試集的標籤,並將結果指定給 y_pred

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Import DecisionTreeClassifier from sklearn.tree
from ____.____ import ____

# Instantiate a DecisionTreeClassifier 'dt' with a maximum depth of 6
dt = ____(____=____, random_state=SEED)

# Fit dt to the training set
____.____(____, ____)

# Predict test set labels
y_pred = ____.____(____)
print(y_pred[0:5])
編輯並執行程式碼