开始使用免费开始使用

使用 spaCy 进行文本处理

每个 NLP 应用都由若干文本处理步骤组成。您已经学习了其中的一些步骤,包括分词、词形还原、句子切分和命名实体识别。

spaCy NLP Pipeline

在本练习中,您将继续练习使用 spaCy 进行文本处理,例如将文本拆分为句子并抽取命名实体。我们将使用 Amazon Fine Food Reviews 数据集中的前 5 条评论。您可以通过 texts 对象访问这些评论。

en_core_web_sm 模型已为您加载,使用 nlp 即可访问。针对 texts 中每一项生成的 Doc 容器列表也已预加载,保存在 documents

本练习是课程的一部分

使用 spaCy 的自然语言处理

查看课程

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]

# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)
编辑并运行代码