使用 spaCy 进行词性标注(POS tagging)
在本练习中,您将练习词性标注(POS tagging)。词性标注是 NLP 中的常用工具,它能帮助算法理解句子的语法结构,并确认像 watch 和 play 这样具有多重含义的词。
在本练习中,en_core_web_sm 已作为 nlp 为您加载。来自 Airline Travel Information System(ATIS)的 3 条评论已放入名为 texts 的列表中供您使用。
本练习是课程的一部分
使用 spaCy 的自然语言处理
练习说明
- 使用列表推导式,构建
documents,其中包含texts列表中每个文本对应的doc容器。 - 对于每个
doc容器,使用嵌套的 for 循环遍历documents以及每个doc的词元,打印每个词元的文本及其对应的词性(POS)标签。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Compile a list of all Doc containers of texts
documents = [____(text) for text in texts]
# Print token texts and POS tags for each Doc container
for doc in documents:
for ____ in doc:
print("Text: ", ____, "| POS tag: ", ____)
print("\n")