创建标记
这一次,您将真正创建一个标记变量:当电子邮件在关注的搜索词上有命中时记为 1,否则为 0。这是您把文本数据内容作为机器学习模型特征,或作为模型结果上的实际标记之前的最后一步。请继续使用包含电子邮件的数据框 df,而 searchfor 列表与上一个练习中定义的一致。
本练习是课程的一部分
Python 中的欺诈检测
练习说明
- 使用 numpy 的条件判断:当清洗后的邮件文本包含
searchfor列表中的词时标记为 1,否则为 0。 - 用"或"运算符将
searchfor列表中的词连接起来。 - 统计新创建的标记变量的取值分布。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create flag variable where the emails match the searchfor terms
df['flag'] = ____.____((df['clean_content'].___.____('____'.____(____)) == True), 1, 0)
# Count the values of the flag variable
count = df['flag'].____()
print(count)