开始使用免费开始使用

基线

将分类器与合适的基线进行比较非常重要。对于类别不平衡的数据集(如广告点击率)更是如此,因为只要始终选择占多数的类别,就很容易获得很高的 accuracy。在本练习中,您将模拟一个始终预测多数类(未点击)的基线分类器,并查看它的混淆矩阵,以及它的 precision 和 recall。

X_trainy_trainX_testy_test 已在您的工作区中可用。pandas 作为 pdnumpy 作为 np,以及 sklearn 也已在您的工作区中可用。

本练习是课程的一部分

用 Python 预测 CTR 的机器学习实战

查看课程

练习说明

  • 使用 np.asarray() 创建与 X_test 长度相同且元素全为 0 的数组 y_pred
  • 打印得到的混淆矩阵。
  • 获取 precision 和 recall 分数。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Set up baseline predictions
y_pred = np.____([0 for x in range(len(X_test))])

# Look at confusion matrix
print("Confusion matrix: ")
print(____(y_test, y_pred))

# Check precision and recall
prec = ____(y_test, y_pred, average = 'weighted')
recall = ____(y_test, y_pred, average = 'weighted')
print("Precision: %s, Recall: %s" %(prec, recall))
编辑并运行代码