使用 spaCy 进行分词
在本练习中,您将练习对文本进行分词。我们将使用 Amazon Fine Food Reviews 数据集中的第一条评论。您可以通过已提供的 text 对象获取这条评论。
en_core_web_sm 模型已为您加载。可通过调用 nlp() 使用它。您可以使用列表推导式来整理输出列表。
本练习是课程的一部分
使用 spaCy 的自然语言处理
练习说明
- 将预加载评论对应的 Doc 容器存入
document对象。 - 将
document中所有 token 的文本提取并查看,存入变量first_text_tokens。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create a Doc container of the given text
document = ____(____)
# Store and review the token text values of tokens for the Doc container
first_text_tokens = [____ for ____ in ____]
print("First text tokens:\n", first_text_tokens, "\n")