從語料庫建立 tibble
為了進一步探索同事提供給你的原油資料語料庫,你決定建立一個流程,清理文件中的文字。你不打算用 tm 套件來做,而是先把語料庫轉成 tibble,這樣就能使用你已熟悉的 unnest_tokens()、count() 和 anti_join() 等函式。語料庫 crude 同時包含每份文件的後設資料與正文文字。
本練習屬於課程
R 的自然語言處理入門
練習說明
- 將語料庫轉換成 tibble。
- 使用
names印出欄位名稱。 - 對
crude_tibble的text欄進行以「字詞」為單位的斷詞、計數,並移除停用字。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)
crude_counts <- crude_tibble %>%
# Tokenize by word
___(___, text) %>%
# Count by word
___(word, sort = TRUE) %>%
# Remove stop words
___(stop_words)