開始使用免費開始

從語料庫建立 tibble

為了進一步探索同事提供給你的原油資料語料庫,你決定建立一個流程,清理文件中的文字。你不打算用 tm 套件來做,而是先把語料庫轉成 tibble,這樣就能使用你已熟悉的 unnest_tokens()count()anti_join() 等函式。語料庫 crude 同時包含每份文件的後設資料與正文文字。

本練習屬於課程

R 的自然語言處理入門

檢視課程

練習說明

  • 將語料庫轉換成 tibble。
  • 使用 names 印出欄位名稱。
  • crude_tibbletext 欄進行以「字詞」為單位的斷詞、計數,並移除停用字。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a tibble & Review
crude_tibble <- ___(crude)
___(crude_tibble)

crude_counts <- crude_tibble %>%
  # Tokenize by word 
  ___(___, text) %>%
  # Count by word
  ___(word, sort = TRUE) %>%
  # Remove stop words
  ___(stop_words)
編輯並執行程式碼