在 spaCy 中添加流水线组件
在不同的 NLP 任务中,您常常会使用现成的 spaCy 模型。然而,在某些情况下,像句子切分这类开箱即用的流水线组件可能需要较长时间才能达到预期效果。本练习中,您将练习向 spaCy 模型(文本处理流水线)中添加一个组件。
本练习将使用 Amazon Fine Food Reviews 数据集中的前 5 条评论。您可以通过字符串 texts 访问这些评论。
spaCy 包已为您导入,可直接使用。
本练习是课程的一部分
使用 spaCy 的自然语言处理
练习说明
- 加载一个空白的
spaCy英文模型,并向模型添加一个sentencizer组件。 - 为
texts创建一个Doc容器,创建一个列表以存储给定文档的sentences,并打印句子数量。 - 打印
sentences列表中第二个句子的分词列表。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load a blank spaCy English model and add a sentencizer component
nlp = spacy.____("en")
nlp.____("sentencizer")
# Create Doc containers, store sentences and print its number of sentences
doc = ____
sentences = [____ for s in ____]
print("Number of sentences: ", len(____), "\n")
# Print the list of tokens in the second sentence
print("Second sentence tokens: ", [____ for ____ in sentences[1]])