TFIDF 練習
先前你看過以 bag-of-words 表示法來表示原油主題的文章。計算 TFIDF 需要依賴這種表示法,但同時會考量某個詞在單一文章中出現的頻率,以及該詞在整個文章集合中出現的頻率。
為了比較不同文章時判斷哪些詞更有意義,請為 crude(一個包含 20 篇原油相關文章的集合)中的詞計算 TFIDF 權重。
本練習屬於課程
R 的自然語言處理入門
練習說明
- 以
article_id與word為單位,為crude計算 TFIDF 值。將結果的 tibble 儲存為crude_weights。 - 使用
arrange()依tf_idf值遞減排序crude_weights。 - 將
crude_weights過濾到最小但非 0 的tf_idf值。同樣使用arrange來完成。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a tibble with TFIDF values
___ <- crude_tibble %>%
unnest_tokens(output = "word", token = "words", input = text) %>%
anti_join(stop_words) %>%
count(article_id, word) %>%
___(___, ___, n)
# Find the highest TFIDF values
crude_weights %>%
___(desc(___))
# Find the lowest non-zero TFIDF values
crude_weights %>%
filter(___ != ___) %>%
___(___)