开始使用免费开始使用

清洗一篇博客文章

在本练习中,您将获得一段博客文章摘录。您的任务是将其清洗为更适合机器处理的格式。这包括转为小写、词形还原(lemmatization),并去除停用词、标点符号以及非字母字符。

该摘录已作为字符串 blog 提供,并已打印到控制台。停用词列表已作为 stopwords 提供。

本练习是课程的一部分

Python 中的 NLP 特征工程

查看课程

练习说明

  • 使用列表推导式遍历 doc,提取每个 token 的 lemma_
  • 使用 stopwordsisalpha() 去除停用词与非字母的 token。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
编辑并运行代码