评估四种类别
混淆矩阵是查看四种结果类别最直接的工具:真正例(TP)、假正例(FP)、真负例(TN)和假负例(FN)。在本练习中,您将使用 sklearn 中的标准决策树分类器 DecisionTreeClassifier() 对示例点击数据进行建模,并计算按照这四类划分的结果统计。
pandas 模块已在工作区以 pd 提供,示例 DataFrame 已加载为 df。特征已加载到 X,目标已加载到 y。此外,您可以使用来自 sklearn.tree 的 DecisionTreeClassifier。
本练习是课程的一部分
用 Python 预测 CTR 的机器学习实战
练习说明
- 为
X和y获取训练集与测试集的切分。 - 定义一个决策树分类器,拟合模型后生成预测
y_pred。 - 使用混淆矩阵获取各类结果的计数,其中
1表示正类(点击),0表示负类(未点击)。 - 例如:真负例对应
[0,0],真正例对应[1,1]。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Set up classifier using training data to predict test data
X_train, X_test, y_train, y_test = ____(
X, y, test_size = .2, random_state = 0)
clf = ____
y_pred = clf.____(X_train, y_train).____(X_test)
# Define confusion matrix and four categories
conf_matrix = ____(y_test, y_pred)
tn = conf_matrix[____][____]
fp = conf_matrix[____][____]
fn = conf_matrix[____][____]
tp = conf_matrix[____][____]
print("TN: %s, FP: %s, FN: %s, TP: %s" %(tn, fp, fn, tp))