h2o の練習
R にはいくつかの Machine Learning ライブラリがありますが、h2o は使いやすく、word2vec の実装も提供しています。h2o は他のさまざまな Machine Learning タスクにも利用できます。ただし、h2o ライブラリを使うには、データに対して追加の前処理が必要です。ここでは、2016年の米国選挙キャンペーン中に自動ツイートされた投稿を含む left_right というデータセットがあります。
他のテキスト分析手法向けにデータを整えるのではなく、h2o ライブラリで使えるようにこのデータセットを準備してください。
この演習はコースの一部です
Rで学ぶ自然言語処理入門
演習の手順
- ライブラリをインポートし、
h2oセッションを初期化します。 h2oオブジェクトを作成します。content列に保存されているツイートをトークン化します。- 単語をすべて小文字に変換し、ストップワードをすべて除去します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Initialize an h2o session
library(___)
___.init()
# Create an h2o object for left_right
h2o_object = as.___(left_right)
# Tokenize the words from the column of text in left_right
tweet_words <- h2o.___(h2o_object$___, "\\\\W+")
# Lowercase
tweet_words <- h2o.___(tweet_words)
# Remove stopwords from tweet_words
tweet_words <- tweet_words[is.na(___) || (!___ %in% stop_words$word),]
tweet_words