基线
将分类器与合适的基线进行比较非常重要。对于类别不平衡的数据集(如广告点击率)更是如此,因为只要始终选择占多数的类别,就很容易获得很高的 accuracy。在本练习中,您将模拟一个始终预测多数类(未点击)的基线分类器,并查看它的混淆矩阵,以及它的 precision 和 recall。
X_train、y_train、X_test、y_test 已在您的工作区中可用。pandas 作为 pd、numpy 作为 np,以及 sklearn 也已在您的工作区中可用。
本练习是课程的一部分
用 Python 预测 CTR 的机器学习实战
练习说明
- 使用
np.asarray()创建与X_test长度相同且元素全为 0 的数组y_pred。 - 打印得到的混淆矩阵。
- 获取 precision 和 recall 分数。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Set up baseline predictions
y_pred = np.____([0 for x in range(len(X_test))])
# Look at confusion matrix
print("Confusion matrix: ")
print(____(y_test, y_pred))
# Check precision and recall
prec = ____(y_test, y_pred, average = 'weighted')
recall = ____(y_test, y_pred, average = 'weighted')
print("Precision: %s, Recall: %s" %(prec, recall))