テキスト分析で失敗する例
これまでに、テキスト分析の前にストップワードを除去する重要性について学びました。直近の章では、コサイン類似度を使ってテキスト同士の近さを特定する方法を復習しました。
この演習では、テキスト分析を正しく使わないとどうなるかを体験します。ここでは、ストップワードを除去せずに、書籍「Animal Farm」の各章のコサイン類似度を計算します。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
- 提供された単語カウントを作成するコードを確認してください。ここまでは完了済みです。
widyrのpairwise_similarity()関数を使い、chapter列の各章についてコサイン類似度を計算してください。- 結果を
similarityの値が高いものから順に並べ替えてください。 similarityの値の平均(mean)を計算してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create word counts
animal_farm_counts <- animal_farm %>%
unnest_tokens(word, text_column) %>%
count(chapter, word)
# Calculate the cosine similarity by chapter, using words
comparisons <- animal_farm_counts %>%
___(___, ___, n) %>%
arrange(desc(___))
# Print the mean of the similarity values
comparisons %>%
summarize(mean = ___(___))