使用 spaCy 进行文本处理
每个 NLP 应用都由若干文本处理步骤组成。您已经学习了其中的一些步骤,包括分词、词形还原、句子切分和命名实体识别。
在本练习中,您将继续练习使用 spaCy 进行文本处理,例如将文本拆分为句子并抽取命名实体。我们将使用 Amazon Fine Food Reviews 数据集中的前 5 条评论。您可以通过 texts 对象访问这些评论。
en_core_web_sm 模型已为您加载,使用 nlp 即可访问。针对 texts 中每一项生成的 Doc 容器列表也已预加载,保存在 documents。
本练习是课程的一部分
使用 spaCy 的自然语言处理
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a list to store sentences of each Doc container in documents
sentences = [[____ for sent in doc.____] for doc in documents]
# Print number of sentences in each Doc container in documents
num_sentences = [len(____) for s in sentences]
print("Number of sentences in documents:\n", ____)