使用术语列表
很多时候,您不只想搜索单个术语。您可以构建一个完整的欺诈术语表("fraud dictionary"),其中包含可能用于标记可疑客户和/或交易的词汇。欺诈分析师通常会对这个词表应包含什么有经验判断。在本练习中,您将标记一系列术语;在下一个练习中,您会据此创建一个新的标记变量。该"标记"既可以作为特征直接用于机器学习模型,也可以作为对模型结果的附加筛选。我们先使用一个术语列表来过滤数据。包含清洗后邮件的数据框仍为 df。
本练习是课程的一部分
Python 中的欺诈检测
练习说明
- 创建一个待搜索的列表,包含 'enron stock'、'sell stock'、'stock bonus' 和 'sell enron stock'。
- 将字符串术语合并为搜索条件。
- 使用与
searchfor列表匹配的邮件来过滤数据。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a list of terms to search for
searchfor = ['____', '____', '____', '____']
# Filter cleaned emails on searchfor list and select from df
filtered_emails = df.____[____['_____'].____._____('|'.join(____), na=False)]
print(filtered_emails)