開始使用免費開始

建立語料庫

你已經建立了一個名為 russian_tweets 的 tibble,裡面包含大約 20,000 則在 2016 年美國選舉期間由機器人自動產生的推文,方便你進行文字分析。不過,在比較可用的分析方式後,你認為 tm 套件是最容易上手的選擇。為了進行分析,你必須先建立一個語料庫,並附加可能有用的中繼資料。

請注意:這是來自 Twitter 的真實資料,因此可能包含粗話或其他具攻擊性的內容(本練習以及後續所有使用真實 Twitter 資料的練習皆然)。

本練習屬於課程

R 的自然語言處理入門

檢視課程

練習說明

  • 使用 russian_tweetscontent 欄建立一個語料庫。
  • followingfollowers 兩個欄位作為中繼資料附加到 tweet_corpus
  • 列印中繼資料表的前幾列。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))

# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___

# Review the meta data
head(meta(___))
編輯並執行程式碼