開始使用免費開始

TFIDF 練習

先前你看過以 bag-of-words 表示法來表示原油主題的文章。計算 TFIDF 需要依賴這種表示法,但同時會考量某個詞在單一文章中出現的頻率,以及該詞在整個文章集合中出現的頻率。

為了比較不同文章時判斷哪些詞更有意義,請為 crude(一個包含 20 篇原油相關文章的集合)中的詞計算 TFIDF 權重。

本練習屬於課程

R 的自然語言處理入門

檢視課程

練習說明

  • article_idword 為單位,為 crude 計算 TFIDF 值。將結果的 tibble 儲存為 crude_weights
  • 使用 arrange()tf_idf 值遞減排序 crude_weights
  • crude_weights 過濾到最小但非 0 的 tf_idf 值。同樣使用 arrange 來完成。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a tibble with TFIDF values
___ <- crude_tibble %>%
  unnest_tokens(output = "word", token = "words", input = text) %>%
  anti_join(stop_words) %>%
  count(article_id, word) %>%
  ___(___, ___, n)

# Find the highest TFIDF values
crude_weights %>%
  ___(desc(___))

# Find the lowest non-zero TFIDF values
crude_weights %>%
  filter(___ != ___) %>%
  ___(___)
編輯並執行程式碼