TFIDF の練習
先ほど、原油に関する記事を bag-of-words で表現しました。TFIDF の計算はこの bag-of-words 表現に基づきますが、ある単語が記事内にどれくらい出現するか、そして記事全体のコレクションでその単語がどれくらい出現するかも考慮します。
異なる記事を比較するときに、どの単語がどれだけ意味を持つかを判断するために、原油に関する 20 本の記事からなる crude の各単語について TFIDF 重みを計算してください。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
crudeについて、article_idとwordごとに TFIDF 値を計算し、結果の tibble をcrude_weightsとして保存します。arrange()関数を使って、crude_weightsをtf_idfを降順で並べ替えます。- 最も小さい非ゼロの
tf_idf値に絞り込むように、crude_weightsをフィルタリングします。ここでもarrange関数を使いましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a tibble with TFIDF values
___ <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(article_id, word) %>%
___(___, ___, n)
# Find the highest TFIDF values
crude_weights %>%
___(desc(___))
# Find the lowest non-zero TFIDF values
crude_weights %>%
filter(___ != ___) %>%
___(___)