一次文本分析失败的示例
在课程前面,您已经讨论过在进行文本分析前移除停用词的重要性。在最近这一章中,您又复习了如何使用余弦相似度来识别彼此相似的文本。
在本练习中,您将探索一个很现实的情形:没有正确使用文本分析而导致失败。您将对《Animal Farm》各章节计算余弦相似度,但不移除停用词。
本练习是课程的一部分
R 自然语言处理入门
练习说明
- 查看提供的用于创建词频的代码。此部分已为您完成。
- 使用
widyr包中的pairwise_similarity()函数,基于chapter列为每个章节计算余弦相似度。 - 将结果按
similarity值从高到低排列。 - 计算
similarity值的平均数mean。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create word counts
animal_farm_counts <- animal_farm %>%
unnest_tokens(word, text_column) %>%
count(chapter, word)
# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
___(___, ___, n) %>%
arrange(desc(___))
# Print the mean of the similarity values
comparisons %>%
summarize(mean = ___(___))