始める無料で始める

h2o の練習

R にはいくつかの Machine Learning ライブラリがありますが、h2o は使いやすく、word2vec の実装も提供しています。h2o は他のさまざまな Machine Learning タスクにも利用できます。ただし、h2o ライブラリを使うには、データに対して追加の前処理が必要です。ここでは、2016年の米国選挙キャンペーン中に自動ツイートされた投稿を含む left_right というデータセットがあります。

他のテキスト分析手法向けにデータを整えるのではなく、h2o ライブラリで使えるようにこのデータセットを準備してください。

この演習はコースの一部です

Rで学ぶ自然言語処理入門

コースを見る

演習の手順

  • ライブラリをインポートし、h2o セッションを初期化します。
  • h2o オブジェクトを作成します。
  • content 列に保存されているツイートをトークン化します。
  • 単語をすべて小文字に変換し、ストップワードをすべて除去します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Initialize an h2o session
library(___)
___.init()

# Create an h2o object for left_right
h2o_object = as.___(left_right)

# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")

# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words
コードを編集して実行