h2o 練習
R 有多種機器學習函式庫可用。不過,h2o 套件容易上手,且提供 word2vec 的實作。h2o 也能用於多種其他機器學習任務。不過,若要使用 h2o 套件,你需要先對資料做一些額外的前處理。你手上有個名為 left_right 的資料集,包含在 2016 年美國總統大選期間自動發布的推文。
現在不要為其他文字分析技術做準備,而是把這個資料集整理成可供 h2o 套件使用的格式。
本練習屬於課程
R 的自然語言處理入門
練習說明
- 匯入套件並初始化
h2o工作階段。 - 建立一個
h2o物件。 - 對存於
content欄位的推文做斷詞(tokenize)。 - 將詞彙轉成小寫並移除所有停用詞。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Initialize an h2o session
library(___)
___.init()
# Create an h2o object for left_right
h2o_object = as.___(left_right)
# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")
# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words