开始使用免费开始使用

在 spaCy 中添加流水线组件

在不同的 NLP 任务中,您常常会使用现成的 spaCy 模型。然而,在某些情况下,像句子切分这类开箱即用的流水线组件可能需要较长时间才能达到预期效果。本练习中,您将练习向 spaCy 模型(文本处理流水线)中添加一个组件。

本练习将使用 Amazon Fine Food Reviews 数据集中的前 5 条评论。您可以通过字符串 texts 访问这些评论。

spaCy 包已为您导入,可直接使用。

本练习是课程的一部分

使用 spaCy 的自然语言处理

查看课程

练习说明

  • 加载一个空白的 spaCy 英文模型,并向模型添加一个 sentencizer 组件。
  • texts 创建一个 Doc 容器,创建一个列表以存储给定文档的 sentences,并打印句子数量。
  • 打印 sentences 列表中第二个句子的分词列表。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")

# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")

# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])
编辑并运行代码