建立語料庫
你已經建立了一個名為 russian_tweets 的 tibble,裡面包含大約 20,000 則在 2016 年美國選舉期間由機器人自動產生的推文,方便你進行文字分析。不過,在比較可用的分析方式後,你認為 tm 套件是最容易上手的選擇。為了進行分析,你必須先建立一個語料庫,並附加可能有用的中繼資料。
請注意:這是來自 Twitter 的真實資料,因此可能包含粗話或其他具攻擊性的內容(本練習以及後續所有使用真實 Twitter 資料的練習皆然)。
本練習屬於課程
R 的自然語言處理入門
練習說明
- 使用
russian_tweets的content欄建立一個語料庫。 - 將
following與followers兩個欄位作為中繼資料附加到tweet_corpus。 - 列印中繼資料表的前幾列。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))
# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___
# Review the meta data
head(meta(___))