始める無料で始める

TFIDF の練習

先ほど、原油に関する記事を bag-of-words で表現しました。TFIDF の計算はこの bag-of-words 表現に基づきますが、ある単語が記事内にどれくらい出現するか、そして記事全体のコレクションでその単語がどれくらい出現するかも考慮します。

異なる記事を比較するときに、どの単語がどれだけ意味を持つかを判断するために、原油に関する 20 本の記事からなる crude の各単語について TFIDF 重みを計算してください。

この演習はコースの一部です

Rで学ぶ自然言語処理入門

コースを見る

演習の手順

  • crude について、article_idword ごとに TFIDF 値を計算し、結果の tibble を crude_weights として保存します。
  • arrange() 関数を使って、crude_weightstf_idf を降順で並べ替えます。
  • 最も小さい非ゼロの tf_idf 値に絞り込むように、crude_weights をフィルタリングします。ここでも arrange 関数を使いましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Create a tibble with TFIDF values
___ <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(article_id, word) %>%
  ___(___, ___, n)

# Find the highest TFIDF values
crude_weights %>%
  ___(desc(___))

# Find the lowest non-zero TFIDF values
crude_weights %>%
  filter(___ != ___) %>%
  ___(___)
コードを編集して実行