評估四種分類結果
混淆矩陣是檢視四種結果類別最直觀的工具:真正類(TP)、假正類(FP)、真負類(TN)與假負類(FN)。在這個練習中,你將使用 sklearn 的標準決策樹分類器 DecisionTreeClassifier() 套用在點擊範例資料上,並計算這四類結果的分佈。
你的工作區中已將 pandas 模組以 pd 載入,範例 DataFrame 已載入為 df。特徵已載入在 X,目標已載入在 y。此外,可使用來自 sklearn.tree 的 DecisionTreeClassifier。
本練習屬於課程
用 Python 透過機器學習預測 CTR
練習說明
- 取得
X與y的訓練集與測試集切分。 - 定義一個決策樹分類器,擬合模型並產生預測
y_pred。 - 使用混淆矩陣取得各類結果的計數,其中
1代表正向(點擊),0代表負向(未點擊)。 - 例如:真負類是
[0,0],真正類是[1,1]。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Set up classifier using training data to predict test data
X_train, X_test, y_train, y_test = ____(
X, y, test_size = .2, random_state = 0)
clf = ____
y_pred = clf.____(X_train, y_train).____(X_test)
# Define confusion matrix and four categories
conf_matrix = ____(y_test, y_pred)
tn = conf_matrix[____][____]
fp = conf_matrix[____][____]
fn = conf_matrix[____][____]
tp = conf_matrix[____][____]
print("TN: %s, FP: %s, FN: %s, TP: %s" %(tn, fp, fn, tp))