開始使用免費開始

h2o 練習

R 有多種機器學習函式庫可用。不過,h2o 套件容易上手,且提供 word2vec 的實作。h2o 也能用於多種其他機器學習任務。不過,若要使用 h2o 套件,你需要先對資料做一些額外的前處理。你手上有個名為 left_right 的資料集,包含在 2016 年美國總統大選期間自動發布的推文。

現在不要為其他文字分析技術做準備,而是把這個資料集整理成可供 h2o 套件使用的格式。

本練習屬於課程

R 的自然語言處理入門

檢視課程

練習說明

  • 匯入套件並初始化 h2o 工作階段。
  • 建立一個 h2o 物件。
  • 對存於 content 欄位的推文做斷詞(tokenize)。
  • 將詞彙轉成小寫並移除所有停用詞。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Initialize an h2o session
library(___)
___.init()

# Create an h2o object for left_right
h2o_object = as.___(left_right)

# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")

# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words
編輯並執行程式碼