开始使用免费开始使用

创建标记

这一次,您将真正创建一个标记变量:当电子邮件在关注的搜索词上有命中时记为 1,否则为 0。这是您把文本数据内容作为机器学习模型特征,或作为模型结果上的实际标记之前的最后一步。请继续使用包含电子邮件的数据框 df,而 searchfor 列表与上一个练习中定义的一致。

本练习是课程的一部分

Python 中的欺诈检测

查看课程

练习说明

  • 使用 numpy 的条件判断:当清洗后的邮件文本包含 searchfor 列表中的词时标记为 1,否则为 0。
  • 用"或"运算符将 searchfor 列表中的词连接起来。
  • 统计新创建的标记变量的取值分布。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create flag variable where the emails match the searchfor terms
df['flag'] = ____.____((df['clean_content'].___.____('____'.____(____)) == True), 1, 0)

# Count the values of the flag variable
count = df['flag'].____()
print(count)
编辑并运行代码