清洗一篇博客文章
在本练习中,您将获得一段博客文章摘录。您的任务是将其清洗为更适合机器处理的格式。这包括转为小写、词形还原(lemmatization),并去除停用词、标点符号以及非字母字符。
该摘录已作为字符串 blog 提供,并已打印到控制台。停用词列表已作为 stopwords 提供。
本练习是课程的一部分
Python 中的 NLP 特征工程
练习说明
- 使用列表推导式遍历
doc,提取每个 token 的lemma_。 - 使用
stopwords和isalpha()去除停用词与非字母的 token。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)
# Generate lemmatized tokens
lemmas = [token.____ for token in ____]
# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in ____]
# Print string after text cleaning
print(' '.join(a_lemmas))