开始使用免费开始使用

评估四种类别

混淆矩阵是查看四种结果类别最直接的工具:真正例(TP)、假正例(FP)、真负例(TN)和假负例(FN)。在本练习中,您将使用 sklearn 中的标准决策树分类器 DecisionTreeClassifier() 对示例点击数据进行建模,并计算按照这四类划分的结果统计。

pandas 模块已在工作区以 pd 提供,示例 DataFrame 已加载为 df。特征已加载到 X,目标已加载到 y。此外,您可以使用来自 sklearn.treeDecisionTreeClassifier

本练习是课程的一部分

用 Python 预测 CTR 的机器学习实战

查看课程

练习说明

  • Xy 获取训练集与测试集的切分。
  • 定义一个决策树分类器,拟合模型后生成预测 y_pred
  • 使用混淆矩阵获取各类结果的计数,其中 1 表示正类(点击),0 表示负类(未点击)。
  • 例如:真负例对应 [0,0],真正例对应 [1,1]

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Set up classifier using training data to predict test data
X_train, X_test, y_train, y_test = ____(
  X, y, test_size = .2, random_state = 0)
clf = ____
y_pred = clf.____(X_train, y_train).____(X_test) 

# Define confusion matrix and four categories
conf_matrix = ____(y_test, y_pred)
tn = conf_matrix[____][____]
fp = conf_matrix[____][____]
fn = conf_matrix[____][____]
tp = conf_matrix[____][____]

print("TN: %s, FP: %s, FN: %s, TP: %s" %(tn, fp, fn, tp))
编辑并运行代码