开始使用免费开始使用

使用 spaCy 进行词形还原

在此练习中,您将练习词形还原。词形还原有助于得到派生词的词根形式。也就是说,对于任意一句话,词形还原后的词数应当小于或等于原始词元数。

第一个 Amazon 食品评论已作为字符串 text 提供。en_core_web_sm 已加载为 nlp,并已在 text 上运行以生成 document,即该文本字符串的 Doc 容器。

tokens 是一个包含 text 的各个词元的列表,也已为您准备好。

本练习是课程的一部分

使用 spaCy 的自然语言处理

查看课程

练习说明

  • document 中所有词元的词形还原结果追加到 lemmas 中,然后打印 lemmas 列表。
  • 打印 tokens 列表,并观察 tokenslemmas 的差异。

交互式实操练习

通过完成这段示例代码来试试这个练习。

document = nlp(text)
tokens = [token.text for token in document]

# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")

# Print tokens and compare with lemmas list
print("Tokens:\n", ____)
编辑并运行代码