開始使用免費開始

停用字與文字雲

現在你已經進入文字探勘的狀態,正悠閒地喝著一杯 chardonnay,我們得再往下挖掘。上一個文字雲中,"chardonnay" 幾乎完全主導了畫面。它太顯眼,導致你無法看出其他有趣的洞見。

我們把停用字擴充到包含 "chardonnay",看看還有哪些常見字原本被蓋過了。

你的工作區裡有整理過的 chardonnay 推文版本,但現在我們要移除一些缺乏資訊量的詞。本練習會用 content() 顯示特定推文供你比較。記得用雙重中括號來索引語料庫清單。

本練習屬於課程

R 的 Bag-of-Words 文本探勘

檢視課程

練習說明

  • chardonnay_corp 的第 24 份文件套用 content()
  • 將英文停用字加入 "chardonnay",並指定給 stops
  • 檢視 stops 的最後 6 個單字。
  • 使用 tm_map() 建立 cleaned_chardonnay_corp:依序傳入 chardonnay_corp、函式 removeWords(),最後是停用字 stops
  • 再次檢視第 24 則推文的 content,比較前後結果。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Review a "cleaned" tweet
___(___)

# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')

# Review last 6 stopwords 
tail(stops)

# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)

# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])
編輯並執行程式碼