訓練你的第一棵分類樹
在這個練習中,你會使用來自 UCI 機器學習資料庫的 Wisconsin Breast Cancer Dataset。你要根據兩個特徵來預測腫瘤是惡性還是良性:腫瘤的平均半徑(radius_mean)以及其平均凹點數量(concave points_mean)。
資料集已經載入你的工作環境,並分為 80% 訓練集與 20% 測試集。特徵矩陣分別指派給 X_train 和 X_test,而標籤陣列分別指派給 y_train 和 y_test,其中類別 1 代表惡性腫瘤,類別 0 代表良性腫瘤。為了讓結果可重現,我們也定義了一個名為 SEED 的變數並將其設為 1。
本練習屬於課程
Machine Learning with Tree-Based Models in Python
練習說明
從
sklearn.tree匯入DecisionTreeClassifier。以最大深度為 6 建立一個
DecisionTreeClassifier,命名為dt。將
dt擬合到訓練集。預測測試集的標籤,並將結果指定給
y_pred。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Import DecisionTreeClassifier from sklearn.tree
from ____.____ import ____
# Instantiate a DecisionTreeClassifier 'dt' with a maximum depth of 6
dt = ____(____=____, random_state=SEED)
# Fit dt to the training set
____.____(____, ____)
# Predict test set labels
y_pred = ____.____(____)
print(y_pred[0:5])