开始使用免费开始使用

一次文本分析失败的示例

在课程前面,您已经讨论过在进行文本分析前移除停用词的重要性。在最近这一章中,您又复习了如何使用余弦相似度来识别彼此相似的文本。

在本练习中,您将探索一个很现实的情形:没有正确使用文本分析而导致失败。您将对《Animal Farm》各章节计算余弦相似度,但不移除停用词。

本练习是课程的一部分

R 自然语言处理入门

查看课程

练习说明

  • 查看提供的用于创建词频的代码。此部分已为您完成。
  • 使用 widyr 包中的 pairwise_similarity() 函数,基于 chapter 列为每个章节计算余弦相似度。
  • 将结果按 similarity 值从高到低排列。
  • 计算 similarity 值的平均数 mean

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Create word counts
animal_farm_counts <- animal_farm %>%
  unnest_tokens(word, text_column) %>%
  count(chapter, word)

# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
  ___(___, ___, n) %>%
  arrange(desc(___))

# Print the mean of the similarity values
comparisons %>%
  summarize(mean = ___(___))
编辑并运行代码