使用 spaCy 进行词形还原
在此练习中,您将练习词形还原。词形还原有助于得到派生词的词根形式。也就是说,对于任意一句话,词形还原后的词数应当小于或等于原始词元数。
第一个 Amazon 食品评论已作为字符串 text 提供。en_core_web_sm 已加载为 nlp,并已在 text 上运行以生成 document,即该文本字符串的 Doc 容器。
tokens 是一个包含 text 的各个词元的列表,也已为您准备好。
本练习是课程的一部分
使用 spaCy 的自然语言处理
练习说明
- 将
document中所有词元的词形还原结果追加到lemmas中,然后打印lemmas列表。 - 打印
tokens列表,并观察tokens与lemmas的差异。
交互式实操练习
通过完成这段示例代码来试试这个练习。
document = nlp(text)
tokens = [token.text for token in document]
# Append the lemma for all tokens in the document
lemmas = [token.____ for token in document]
print("Lemmas:\n", ____, "\n")
# Print tokens and compare with lemmas list
print("Tokens:\n", ____)