移除停用词
在接下来的练习中,您将清洗 Enron 邮件,以便在主题模型中使用这些数据。文本清洗可能比较棘手,所以您会学习一些有效的步骤。包含邮件的数据框 df 已提供。第一步,您需要定义要在下一练习中从文本数据中移除的停用词和标点符号列表。请试试看。
本练习是课程的一部分
Python 中的欺诈检测
练习说明
- 从
ntlk导入停用词。 - 将 'english' 词表用作停用词,并赋给变量
stop。 - 从
string包获取标点集合,并将其赋给exclude。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Import nltk packages and string
from nltk.corpus import ____
import string
# Define stopwords to exclude
stop = set(____.____('____'))
stop.update(("to","cc","subject","http","from","sent", "ect", "u", "fwd", "www", "com"))
# Define punctuations to exclude and lemmatizer
exclude = set(____.____)