停用字與文字雲
現在你已經進入文字探勘的狀態,正悠閒地喝著一杯 chardonnay,我們得再往下挖掘。上一個文字雲中,"chardonnay" 幾乎完全主導了畫面。它太顯眼,導致你無法看出其他有趣的洞見。
我們把停用字擴充到包含 "chardonnay",看看還有哪些常見字原本被蓋過了。
你的工作區裡有整理過的 chardonnay 推文版本,但現在我們要移除一些缺乏資訊量的詞。本練習會用 content() 顯示特定推文供你比較。記得用雙重中括號來索引語料庫清單。
本練習屬於課程
R 的 Bag-of-Words 文本探勘
練習說明
- 對
chardonnay_corp的第 24 份文件套用content()。 - 將英文停用字加入
"chardonnay",並指定給stops。 - 檢視
stops的最後 6 個單字。 - 使用
tm_map()建立cleaned_chardonnay_corp:依序傳入chardonnay_corp、函式removeWords(),最後是停用字stops。 - 再次檢視第
24則推文的content,比較前後結果。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Review a "cleaned" tweet
___(___)
# Add to stopwords
stops <- c(stopwords(kind = 'en'), '___')
# Review last 6 stopwords
tail(stops)
# Apply to a corpus
cleaned_chardonnay_corp <- ___(chardonnay_corp, ___, ___)
# Review a "cleaned" tweet again
content(cleaned_chardonnay_corp[[24]])